технический отчет о gpt-oss-safeguard

Оценка производительности и базовых показателей gpt-oss-safeguard-120b и gpt-oss-safeguard-20b
Введение
gpt-oss-safeguard-120b и gpt-oss-safeguard-20b — это две модели рассуждений с открытыми весами (open-weight), прошедшие дополнительное обучение на базе моделей gpt-oss и обученные рассуждать на основе предоставленной политики с целью классификации контента в соответствии с этой политикой. Они доступны по лицензии Apache 2.0 и в соответствии с нашей политикой использования gpt-oss. Разработанные с учетом отзывов открытого сообщества, эти текстовые модели совместимы с нашим API Responses. Модели настраиваемы, обеспечивают полный ход рассуждений (CoT — chain-of-thought), могут использоваться с различной интенсивностью рассуждений (низкая, средняя, высокая) и поддерживают структурированный вывод (Structured Outputs).
В этом отчете мы описываем возможности gpt-oss-safeguard и представляем базовые оценки безопасности моделей gpt-oss-safeguard, используя базовые модели gpt-oss в качестве отправной точки. Для получения дополнительной информации о разработке и архитектуре базовых моделей gpt-oss см. оригинальную карточку модели gpt-oss.
Мы рекомендуем использовать эти модели для классификации контента по заданной политике, а не в качестве основного функционала, с которым взаимодействуют конечные пользователи; для таких приложений лучше подходят оригинальные модели gpt-oss. Приведенные ниже показатели безопасности описывают работу моделей gpt-oss-safeguard в режиме чата. Модели gpt-oss-safeguard не предназначены для такого использования, но, поскольку это открытые модели, кто-то может использовать их подобным образом. Из-за такой возможности мы захотели убедиться, что они соответствуют нашим стандартам безопасности при таком сценарии использования; в этом отчете представлены результаты этих тестов. Мы также делимся предварительной оценкой многоязычной производительности в режиме чата; обратите внимание, что это не является прямой оценкой производительности при классификации контента по предоставленной политике.
Модели gpt-oss-safeguard представляют собой дообученные версии своих аналогов gpt-oss и тренировались без каких-либо дополнительных данных из области биологии или кибербезопасности. В результате мы пришли к выводу, что предыдущая работа по оценке наихудших сценариев для релизов LLM с открытыми весами применительно переносится и на эти новые модели.
Автор
Полный текст статьи читайте на OpenAI
