Карточка моделей gpt-oss-120b и gpt-oss-20b

Open_Model_SystemCard_1x1.png?w=1600&h=9
Читать карточку модели

Введение

Мы представляем gpt-oss-120b и gpt-oss-20b — две модели с открытыми весами и поддержкой логических рассуждений, доступные по лицензии Apache 2.0 и в соответствии с нашей политикой использования gpt-oss. Разработанные с учетом отзывов сообщества открытого кода, эти текстовые модели совместимы с нашим API Responses и предназначены для использования в агентских рабочих процессах. Они обладают высокой способностью следовать инструкциям, использовать такие инструменты, как веб-поиск и выполнение кода на Python, а также возможностями логического вывода, включая способность настраивать глубину рассуждений для задач, не требующих сложных мыслительных процессов. Модели настраиваемы, предоставляют полный стек цепочки рассуждений (CoT) и поддерживают структурированные выходы (Structured Outputs).

Безопасность лежит в основе нашего подхода к открытым моделям. У них иной профиль рисков по сравнению с проприетарными моделями: после их выпуска злоумышленники могут дообучить их (fine-tune) для обхода защитных отказов или прямой оптимизации нанесения вреда без возможности для OpenAI внедрить дополнительные меры минимизации рисков или отозвать доступ.

В некоторых контекстах разработчикам и предприятиям потребуется реализовать дополнительные средства защиты, чтобы воспроизвести системные меры безопасности, встроенные в модели, предоставляемые через наш API и продукты. Мы называем этот документ карточкой модели (model card), а не карточкой системы (system card), поскольку модели gpt-oss будут использоваться в составе самых разных систем, создаваемых и поддерживаемых самыми разными заинтересованными сторонами. Хотя модели по умолчанию спроектированы так, чтобы следовать политикам безопасности OpenAI, другие участники также будут принимать и реализовывать собственные решения о том, как обеспечивать безопасность этих систем.

Мы провели масштабируемые оценки возможностей gpt-oss-120b и подтвердили, что модель по умолчанию не достигает наших индикативных порогов высоких возможностей (High capability) ни в одной из трех отслеживаемых категорий нашей структуры готовности (Preparedness Framework): биологические и химические возможности, кибернетические возможности, а также самосовершенствование ИИ. Мы также исследовали два дополнительных вопроса:

  • Могут ли злоумышленники дообучить gpt-oss-120b для достижения высоких возможностей в биологической, химической или кибернетической областях? Симулируя потенциальные действия злоумышленника, мы состязательно дообучили (adversarially fine-tuned) модель gpt-oss-120b для этих двух категорий. Консультативная группа OpenAI по безопасности («SAG») изучила результаты этого тестирования и пришла к выводу, что даже при надежном дообучении с использованием передового стека обучения OpenAI модель gpt-oss-120b не достигла высоких возможностей в биологических, химических или кибернетических рисках.
  • Приведет ли выпуск gpt-oss-120b к значительному продвижению границ биологических возможностей в открытых базовых моделях? Мы выяснили, что ответ отрицательный: в большинстве оценок производительность одной или нескольких существующих открытых моделей по умолчанию близка к показателям gpt-oss-120b после состязательного дообучения.

В рамках этого запуска OpenAI подтверждает свою приверженность принципам продвижения безопасного ИИ на благо общества и повышению стандартов безопасности во всей экосистеме.

Автор

OpenAI

Полный текст статьи читайте на OpenAI