Помогаем разработчикам создавать более безопасные ИИ-интерфейсы для подростков
Представляем набор политик безопасности для подростков, оформленных в виде промптов для gpt-oss-safeguard
Сегодня мы выпускаем основанные на промптах политики безопасности, которые помогут разработчикам создавать средства защиты для подростков с учетом их возраста. Эти политики, созданные для работы с нашей моделью безопасности с открытыми весами gpt-oss-safeguard, упрощают преобразование требований безопасности в пригодные для использования классификаторы для реальных систем.
Мы выпустили модели с открытыми весами, чтобы демократизировать доступ к мощному ИИ и поддержать широкие инновации. В то же время мы убеждены, что безопасность и инновации идут рука об руку, и разработчики должны иметь доступ не только к производительным моделям, но и к инструментам и политикам для их безопасного и ответственного развертывания. Мы разработали эти правила, чтобы поддержать разработчиков в их стремлении защитить юных пользователей. При создании учитывались отзывы доверенных внешних организаций, включая Common Sense Media и everyone.ai.
Мы понимаем, что у подростков и взрослых разные потребности и что подросткам необходима дополнительная защита. Эти политики призваны помочь разработчикам учесть эти различия и создавать интерфейсы, которые одновременно расширяют возможности молодых пользователей и подходят им по возрасту.
Развитие нашей масштабной работы по защите молодежи
Мы давно стремимся создавать искусственный интеллект, который расширяет возможности молодежи, обеспечивая при этом их безопасность. В рамках этой работы мы обновили спецификацию модели (Model Spec) — руководство, определяющее предполагаемое поведение моделей OpenAI, — включив в нее принципы для лиц младше 18 лет (U18), а также внедрили средства защиты на уровне продуктов, такие как родительский контроль и определение возраста для лучшей защиты молодых пользователей. Мы также призвали к внедрению средств защиты в масштабах всей индустрии с помощью нашей концепции безопасности подростков (Teen Safety Blueprint).
Сегодняшний релиз опирается на этот фундамент. Мы делаем эти политики безопасности доступными для разработчиков, чтобы помочь им внедрять средства защиты подростков и способствовать демократизации доступа во всей экосистеме открытых весов.
Превращение правил безопасности для подростков в четкие, применимые на практике политики
Хотя классификаторы безопасности вроде gpt-oss-safeguard могут обнаруживать вредоносный контент, их работа зависит от четких определений того, что именно представляет собой такой контент. На практике одна из главных проблем, с которыми сталкиваются разработчики, — это формулирование правил, которые точно учитывают специфические для подростков риски и могут последовательно применяться в реальных системах.
Даже опытные команды часто испытывают трудности при переходе от высокоуровневых целей безопасности к точным операционным правилам, особенно учитывая, что это требует как экспертных знаний в предметной области, так и глубокого понимания ИИ. Это может привести к пробелам в защите, непоследовательному применению правил или избыточно широкой фильтрации. Четкие, хорошо проработанные политики являются важнейшей основой для эффективных систем безопасности.
Помощь разработчикам в практическом применении средств безопасности для подростков
Чтобы решить эту задачу, мы выпускаем набор политик безопасности, адаптированных к типичным рискам, с которыми сталкиваются подростки. Они созданы на основе тщательного анализа существующих исследований об уникальных возрастных особенностях развития подростков. Эти политики структурированы в виде промптов, которые можно напрямую использовать с gpt-oss-safeguard и другими моделями для рассуждений, что позволяет разработчикам проще применять единые стандарты безопасности в своих системах.
Первоначальный релиз включает политики, охватывающие следующие области:
- Контент с откровенным насилием
- Откровенный контент сексуального характера
- Вредные идеалы и поведение в отношении тела
- Опасные виды деятельности и челленджи
- Ролевые игры романтического или жестокого характера
- Товары и услуги с возрастными ограничениями
Эти политики могут использоваться как для фильтрации контента в реальном времени, так и для автономного анализа пользовательского контента.
Структурируя политики в виде промптов, разработчики могут проще интегрировать их в существующие рабочие процессы, адаптировать под свои задачи и дорабатывать с течением времени.

Разработано при участии внешних экспертов
Мы сотрудничали с внешними организациями, включая Common Sense Media и everyone.ai, чтобы учесть их мнение при разработке этих политик. Их экспертные знания помогли определить охват контента, улучшить структуру промптов и уточнить пограничные случаи, которые необходимо учитывать при их оценке.
Эта работа отражает наше постоянное стремление сотрудничать с экспертами и более широкой экосистемой для улучшения того, как системы ИИ поддерживают молодежь.
«Одним из самых больших пробелов в обеспечении безопасности ИИ для подростков было отсутствие четких, применимых на практике политик, на которые разработчики могли бы опираться. Зачастую разработчикам приходится начинать с нуля. Эти основанные на промптах политики помогают задать значимый стандарт безопасности во всей экосистеме, а поскольку они выпускаются в рамках открытого исходного кода, их можно адаптировать и совершенствовать со временем. Мы рады видеть, что инфраструктура такого рода становится широко доступной, и надеемся, что это послужит катализатором появления общих отправных точек для обеспечения безопасности молодежи во всей индустрии».
—Робби Торни (Robbie Torney), руководитель отдела искусственного интеллекта и цифровой оценки в Common Sense Media
«Подобные инициативы, делающие правила безопасности для молодежи более применимыми на практике, ценны тем, что они помогают перевести экспертные знания в руководства, которые можно использовать в реальных системах. Контентные политики — это важный первый шаг, который также открывает путь к более масштабной работе над тем, как поведение моделей может влиять на риски для молодежи в долгосрочной перспективе. Вдохновленная этой работой и собственными исследованиями, компания everyone.ai также создала начальную поведенческую политику, сосредоточенную на таких рисках, как изоляция и чрезмерная зависимость».
—Д-р Матильда Чериоли (Dr. Mathilde Cerioli), главный научный сотрудник everyone.AI
Отправная точка, а не готовое решение
Эти политики задуманы как отправная точка, а не как исчерпывающее или окончательное определение или гарантия безопасности подростков. У каждого приложения есть свои уникальные риски, аудитория и контекст, и разработчики лучше всего понимают те угрозы, которые могут представлять их продукты и интеграции ИИ. Мы настоятельно рекомендуем разработчикам адаптировать и расширять эти политики с учетом их конкретных потребностей, а также комбинировать их с другими средствами защиты, такими как решения по дизайну продуктов, элементы управления для пользователей, понятная для подростков прозрачность, системы мониторинга и продуманная реакция с учетом возраста.
Мы убеждены, что многоуровневый подход с обеспечением эшелонированной защиты имеет решающее значение для создания более безопасных систем ИИ. Данные политики основаны на нашем внутреннем опыте, однако они не отражают в полной мере внутренние правила или меры безопасности OpenAI.
Дальнейшие шаги
Мы выпускаем эти политики в качестве открытого исходного кода через сообщество моделей ROOST (ROOST Model Community), чтобы стимулировать сотрудничество и доработку. Чтобы внести свой вклад, оставить отзыв или поделиться дополнительными правилами безопасности для подростков, посетите репозиторий RMC на GitHub.
Разработчики и организации могут адаптировать эти политики под свои конкретные приложения, переводить их на разные языки и расширять для охвата новых областей риска. Со временем мы надеемся, что это послужит более надежной и общей основой для внедрения политик безопасности в системах ИИ.
Чтобы начать работу с gpt-oss-safeguard, загрузите ее с платформы Hugging Face.
Полный текст статьи читайте на OpenAI
