Представляем gpt-oss-safeguard
Новые открытые модели рассуждений для обеспечения безопасности (120b и 20b), поддерживающие настраиваемые правила безопасности.
Сегодня мы выпускаем предварительную исследовательскую версию gpt-oss-safeguard — наших моделей с открытым весом для задач классификации безопасности с возможностью рассуждения. Они доступны в двух размерах: gpt-oss-safeguard-120b и gpt-oss-safeguard-20b. Эти модели представляют собой дообученные версии наших открытых моделей gpt-oss и доступны на условиях той же либеральной лицензии Apache 2.0, позволяющей любому пользователю свободно использовать, модифицировать и развертывать их. Обе модели уже можно загрузить на платформе Hugging Face.
Модели gpt-oss-safeguard используют возможности рассуждения для непосредственной интерпретации предоставленной разработчиком политики во время инференса — классифицируя пользовательские сообщения, завершения и полноценные чаты в соответствии с потребностями разработчика. Разработчик всегда сам определяет используемую политику, благодаря чему ответы получаются более релевантными и адаптированными под конкретный сценарий использования. Модель применяет цепочку рассуждений (chain-of-thought), которую разработчик может изучить, чтобы понять, как модель пришла к своим выводам. Кроме того, политика задается в процессе инференса, а не встраивается на этапе обучения модели, поэтому разработчики могут легко и итеративно пересматривать политики для повышения эффективности. Этот подход, изначально разработанный нами для внутреннего использования, значительно гибче традиционного метода обучения классификатора для косвенного вывода границы принятия решений на основе большого числа размеченных примеров.
gpt-oss-safeguard позволяет разработчикам устанавливать границы политики, наилучшим образом соответствующие их задачам. Например, дискуссионный форум по видеоиграм может разработать политику для классификации постов, обсуждающих жульничество в игре, а сайт с обзорами продуктов — использовать собственную политику для фильтрации отзывов, которые кажутся фальшивыми.
Модель принимает два входа одновременно — политику и контент для классификации в рамках этой политики — и выдает заключение о том, к какой категории относится контент, а также обоснование своего решения. Разработчики сами решают, как именно (и стоит ли вообще) использовать эти заключения в своих пайплайнах безопасности. Мы заметили, что такой подход на основе рассуждений демонстрирует наилучшие результаты в ситуациях, когда:
- Потенциальный вред носит зарождающийся или меняющийся характер, и политики должны быстро адаптироваться.
- Предметная область крайне нюансирована, и с ней трудно справляться меньшим по размеру классификаторам.
- У разработчиков недостаточно примеров для обучения качественного классификатора под каждый риск на своей платформе.
- Задержка (латентность) имеет меньшее значение, чем получение качественных и объяснимых меток.
Мы выпускаем эту предварительную версию gpt-oss-safeguard, чтобы получить отзывы от исследовательского сообщества и специалистов по безопасности, а также продолжить работу над производительностью модели. В течение нескольких месяцев мы работали над этим релизом с открытым весом совместно с организацией ROOST, чтобы выявить важнейшие потребности разработчиков, протестировать модель и подготовить документацию. В рамках этого запуска ROOST создает сообщество моделей (также запускается сегодня) для изучения открытых моделей искусственного интеллекта с целью защиты онлайн-пространства. Одновременно с этим релизом мы публикуем краткий технический отчет, в котором подробно описываются показатели безопасности данной предварительной версии модели.
Безопасность на системном уровне: роль классификаторов безопасности
Когда речь заходит о безопасности, мы верим в эшелонированную защиту. Мы обучаем наши модели отвечать безопасным образом и внедряем дополнительные уровни защиты для обнаружения и обработки потенциально небезопасных входных и выходных данных в соответствии с нашими правилами. Классификаторы безопасности, которые отделяют безопасный контент от небезопасного в конкретной сфере рисков, уже давно служат основным рубежом обороны как для наших собственных, так и для других больших языковых моделей.
Традиционные классификаторы безопасности, подобные тем, что доступны через наш API модерации, разрабатываются путем ручного отбора тысяч примеров безопасного и небезопасного контента в рамках предопределенных политик безопасности. На основе этих обучающих данных классификатор учится отличать безопасные результаты от небезопасных. В рамках этого традиционного подхода классификатор никогда не видит саму политику безопасности. Вместо этого он пытается угадать лежащую в основе политику, которая использовалась для разметки примеров, находя сходства в контенте, помеченном как небезопасный, и различия между небезопасным и безопасным контентом.
Традиционные классификаторы могут обеспечивать высокую производительность, низкую задержку и минимальные операционные расходы. Однако сбор достаточного количества обучающих примеров может потребовать много времени и средств, а обновление или изменение политики требует переобучения классификатора.
Модель gpt-oss-safeguard отличается тем, что ее возможности рассуждения позволяют разработчикам применять любую политику, включая те, которые они пишут сами или заимствуют из других источников, а логический аппарат помогает моделям обобщать данные на основе заново написанных политик. Помимо политик безопасности, gpt-oss-safeguard можно использовать для разметки контента и другими способами, важными для конкретных продуктов и платформ.
Как мы используем рассуждения о безопасности внутри компании
Наши основные модели рассуждений теперь напрямую усваивают политики безопасности и используют свои аналитические способности для оценки того, что является безопасным. Этот подход, который мы называемсознательным выравниванием (deliberative alignment), значительно превосходит более ранние методы обучения безопасности и делает наши модели рассуждений более безопасными по нескольким направлениям по сравнению с их предшественниками без возможностей рассуждения, даже несмотря на рост их возможностей. Однако рассуждения полезны не только для обучения самих моделей. Они также открывают новые возможности для эшелонированной защиты. Подходы на основе рассуждений более гибкие и в меньшей степени ограничены деталями их предыдущего обучения — эти преимущества порой с лихвой оправдывают дополнительные вычислительные затраты и задержки, которые они влекут за собой.
gpt-oss-safeguard — это реализация с открытым весом подхода, который мы разработали внутри компании в виде инструмента под названием Safety Reasoner. Мы начали с дообучения с подкреплением на задачах разметки политик, вознаграждая модель за отражение правильных суждений экспертов-людей. Это научило модель рассуждать о том, как политика приводит к ее суждению. Сегодня Safety Reasoner позволяет нам динамически обновлять наши политики безопасности в рабочей среде значительно быстрее, чем потребовалось бы для переобучения классификатора. Это делает Safety Reasoner ключевым инструментом для итеративного развертывания: когда мы развертываем новые модели в продакшене, мы часто начинаем с более строгих политик и используем относительно большие объемы вычислений там, где это необходимо, чтобы Safety Reasoner мог тщательно применять эти политики. Затем мы корректируем политики по мере улучшения нашего понимания рисков в рабочей среде. В некоторых из наших недавних запусков доля общих вычислений, выделяемых на рассуждения о безопасности, достигала 16%.
Safety Reasoner стал ключевым компонентом нашего стека безопасности. Для генерации изображений и Sora 2 инструмент выполняет динамические пошаговые оценки результатов, чтобы выявлять и блокировать небезопасный сгенерированный контент в реальном времени. В таких областях, как биология и самоповреждение, мы запускаем такие модели, как те, что используются в API модерации, в качестве небольших, быстрых и высокочувствительных классификаторов для определения того, какой контент попадает в интересующую область, а затем используем Safety Reasoner для проверки этого контента. Safety Reasoner классифицирует результаты работы модели по подробной таксономии, чтобы определить оптимальный способ реагирования, являясь частью наших многоуровневых средств защиты в таких системах, как GPT-5 и ChatGPT Agent. И теперь модели gpt-oss-safeguard делают этот же подход доступным для каждого.
Производительность gpt-oss-safeguard
Мы оценили модели gpt-oss-safeguard на внутренних и внешних наборах тестов.
В ходе внутренней оценки мы одновременно передавали несколько политик в gpt-oss-safeguard на этапе инференса. Для каждого тестового входа мы оценивали, правильно ли gpt-oss-safeguard классифицирует текст по всем включенным политикам. Это сложная задача: модель считается точной только в том случае, если ее ответы полностью совпадают с эталонными разметками для всех включенных политик.
Наши модели gpt-oss-safeguard и внутренний инструмент Safety Reasoner превосходят gpt-5-thinking и открытые модели gpt-oss по точности работы с несколькими политиками. Тот факт, что модели gpt-oss-safeguard превосходят gpt-5-thinking, выглядит особенно удивительно, учитывая небольшой размер первых.
Мы также провели оценку этих моделей на наборе данных по модерации, который мы выпустили вместе с нашей исследовательской статьей 2022 года, а также на ToxicChat — общедоступном бенчмарке, основанном на запросах пользователей к чат-боту с открытым исходным кодом.
На наборе данных оценки модерации за 2022 год мы проводили тестирование с использованием наших внутренних политик безопасности (адаптировав одну политику с учетом последующих изменений). gpt-oss-safeguard показала себя немного лучше всех остальных протестированных моделей, включая наш внутренний Safety Reasoner и gpt-5-thinking, хотя эта разница между Safety Reasoner и gpt-oss-safeguard не является статистически значимой.
В случае с ToxicChat оценка проводилась с использованием короткого промпта, написанного вручную и адаптированного на основе некоторых наших внутренних политик. Наш внутренний Safety Reasoner снова превзошел gpt-5-thinking, в то время как gpt-5-thinking и Safety Reasoner незначительно опережают gpt-oss-safeguard-120b и gpt-oss-safeguard-20b. Мы полагаем, что относительно небольшой размер gpt-oss-safeguard все равно делает ее предпочтительной для задач подобного рода.
Ограничения
У gpt-oss-safeguard есть два специфических ограничения. Во-первых, мы заметили, что классификаторы, обученные на десятках тысяч высококачественных размеченных примеров, все еще могут эффективнее классифицировать контент, чем gpt-oss-safeguard при рассуждении непосредственно на основе политики. Затраты времени на обучение специализированного классификатора могут оказаться предпочтительнее для достижения более высокой производительности при работе со сложными рисками.
Во-вторых, gpt-oss-safeguard может быть ресурсоемкой и требовательной ко времени моделью, что затрудняет ее масштабирование для всего контента платформы. Внутри компании мы решаем эту проблему несколькими способами с помощью Safety Reasoner: (1) мы используем меньшие и более быстрые классификаторы для определения того, какой контент требует оценки, и (2) в некоторых случаях мы используем Safety Reasoner асинхронно, чтобы обеспечить низкую задержку для пользователя и при этом сохранить возможность вмешательства при обнаружении небезопасного контента.
Дальнейшие шаги: продолжаем создавать технологии вместе с сообществом
gpt-oss-safeguard — это первый набор открытых моделей безопасности от OpenAI, созданный совместно с сообществом. Мы дорабатывали gpt-oss-safeguard совместно со специалистами по доверию и безопасности из SafetyKit, ROOST, Tomoroи Discord в рамках раннего тестирования. Технический директор ROOST Винай Рао (Vinay Rao) отмечает: «gpt-oss-safeguard — это первая модель рассуждений с открытым исходным кодом, созданная по принципу «принесите свои собственные политики и определения вреда». Организации заслуживают возможности свободно изучать, модифицировать и использовать критически важные технологии безопасности, а также внедрять инновации. В ходе нашего тестирования модель отлично справилась с пониманием различных политик, объяснением своих рассуждений и проявлением нюансов при применении политик, что, как мы верим, пойдет на пользу разработчикам и командам безопасности».
Мы продолжим итеративную работу с сообществом над улучшением инструментов обеспечения открытой безопасности, в том числе через Сообщество моделей ROOST (ROOST Model Community, RMC). RMC объединяет практиков и исследователей в области безопасности для обмена передовым опытом внедрения открытых моделей ИИ в рабочие процессы безопасности, включая результаты оценки и отзывы о моделях. Посетите репозиторий RMC на GitHub, чтобы узнать больше об этом партнерстве и о том, как принять в нем участие.
Чтобы начать разработку с использованием этих моделей, загрузите их с платформы Hugging Face.
Автор
Полный текст статьи читайте на OpenAI
