Помогаем разработчикам создавать более безопасные ИИ-интерфейсы для подростков

Представляем набор политик безопасности для подростков, оформленных в виде промптов для gpt-oss-safeguard

Сегодня мы выпускаем основанные на промптах политики безопасности, которые помогут разработчикам создавать средства защиты для подростков с учетом их возраста. Эти политики, созданные для работы с нашей моделью безопасности с открытыми весами gpt-oss-safeguard, упрощают преобразование требований безопасности в пригодные для использования классификаторы для реальных систем.

Мы выпустили модели с открытыми весами, чтобы демократизировать доступ к мощному ИИ и поддержать широкие инновации. В то же время мы убеждены, что безопасность и инновации идут рука об руку, и разработчики должны иметь доступ не только к производительным моделям, но и к инструментам и политикам для их безопасного и ответственного развертывания. Мы разработали эти правила, чтобы поддержать разработчиков в их стремлении защитить юных пользователей. При создании учитывались отзывы доверенных внешних организаций, включая Common Sense Media и everyone.ai.

Мы понимаем, что у подростков и взрослых разные потребности и что подросткам необходима дополнительная защита. Эти политики призваны помочь разработчикам учесть эти различия и создавать интерфейсы, которые одновременно расширяют возможности молодых пользователей и подходят им по возрасту.

Развитие нашей масштабной работы по защите молодежи

Мы давно стремимся создавать искусственный интеллект, который расширяет возможности молодежи, обеспечивая при этом их безопасность. В рамках этой работы мы обновили спецификацию модели (Model Spec) — руководство, определяющее предполагаемое поведение моделей OpenAI, — включив в нее принципы для лиц младше 18 лет (U18), а также внедрили средства защиты на уровне продуктов, такие как родительский контроль и определение возраста для лучшей защиты молодых пользователей. Мы также призвали к внедрению средств защиты в масштабах всей индустрии с помощью нашей концепции безопасности подростков (Teen Safety Blueprint).

Сегодняшний релиз опирается на этот фундамент. Мы делаем эти политики безопасности доступными для разработчиков, чтобы помочь им внедрять средства защиты подростков и способствовать демократизации доступа во всей экосистеме открытых весов.

Превращение правил безопасности для подростков в четкие, применимые на практике политики

Хотя классификаторы безопасности вроде gpt-oss-safeguard могут обнаруживать вредоносный контент, их работа зависит от четких определений того, что именно представляет собой такой контент. На практике одна из главных проблем, с которыми сталкиваются разработчики, — это формулирование правил, которые точно учитывают специфические для подростков риски и могут последовательно применяться в реальных системах.

Даже опытные команды часто испытывают трудности при переходе от высокоуровневых целей безопасности к точным операционным правилам, особенно учитывая, что это требует как экспертных знаний в предметной области, так и глубокого понимания ИИ. Это может привести к пробелам в защите, непоследовательному применению правил или избыточно широкой фильтрации. Четкие, хорошо проработанные политики являются важнейшей основой для эффективных систем безопасности.

Помощь разработчикам в практическом применении средств безопасности для подростков

Чтобы решить эту задачу, мы выпускаем набор политик безопасности, адаптированных к типичным рискам, с которыми сталкиваются подростки. Они созданы на основе тщательного анализа существующих исследований об уникальных возрастных особенностях развития подростков. Эти политики структурированы в виде промптов, которые можно напрямую использовать с gpt-oss-safeguard и другими моделями для рассуждений, что позволяет разработчикам проще применять единые стандарты безопасности в своих системах.

Первоначальный релиз включает политики, охватывающие следующие области:

  • Контент с откровенным насилием
  • Откровенный контент сексуального характера
  • Вредные идеалы и поведение в отношении тела
  • Опасные виды деятельности и челленджи
  • Ролевые игры романтического или жестокого характера
  • Товары и услуги с возрастными ограничениями

Эти политики могут использоваться как для фильтрации контента в реальном времени, так и для автономного анализа пользовательского контента.

Структурируя политики в виде промптов, разработчики могут проще интегрировать их в существующие рабочие процессы, адаптировать под свои задачи и дорабатывать с течением времени.

Diagram depicting teen safety policy categories and teen-related content feeding into a GPT-OSS safeguard system, which produces policy decisions informed by internal reasoning.

Разработано при участии внешних экспертов

Мы сотрудничали с внешними организациями, включая Common Sense Media и everyone.ai, чтобы учесть их мнение при разработке этих политик. Их экспертные знания помогли определить охват контента, улучшить структуру промптов и уточнить пограничные случаи, которые необходимо учитывать при их оценке.

Эта работа отражает наше постоянное стремление сотрудничать с экспертами и более широкой экосистемой для улучшения того, как системы ИИ поддерживают молодежь.

«Одним из самых больших пробелов в обеспечении безопасности ИИ для подростков было отсутствие четких, применимых на практике политик, на которые разработчики могли бы опираться. Зачастую разработчикам приходится начинать с нуля. Эти основанные на промптах политики помогают задать значимый стандарт безопасности во всей экосистеме, а поскольку они выпускаются в рамках открытого исходного кода, их можно адаптировать и совершенствовать со временем. Мы рады видеть, что инфраструктура такого рода становится широко доступной, и надеемся, что это послужит катализатором появления общих отправных точек для обеспечения безопасности молодежи во всей индустрии».

Робби Торни (Robbie Torney), руководитель отдела искусственного интеллекта и цифровой оценки в Common Sense Media

«Подобные инициативы, делающие правила безопасности для молодежи более применимыми на практике, ценны тем, что они помогают перевести экспертные знания в руководства, которые можно использовать в реальных системах. Контентные политики — это важный первый шаг, который также открывает путь к более масштабной работе над тем, как поведение моделей может влиять на риски для молодежи в долгосрочной перспективе. Вдохновленная этой работой и собственными исследованиями, компания everyone.ai также создала начальную поведенческую политику, сосредоточенную на таких рисках, как изоляция и чрезмерная зависимость».

Д-р Матильда Чериоли (Dr. Mathilde Cerioli), главный научный сотрудник everyone.AI

Отправная точка, а не готовое решение

Эти политики задуманы как отправная точка, а не как исчерпывающее или окончательное определение или гарантия безопасности подростков. У каждого приложения есть свои уникальные риски, аудитория и контекст, и разработчики лучше всего понимают те угрозы, которые могут представлять их продукты и интеграции ИИ. Мы настоятельно рекомендуем разработчикам адаптировать и расширять эти политики с учетом их конкретных потребностей, а также комбинировать их с другими средствами защиты, такими как решения по дизайну продуктов, элементы управления для пользователей, понятная для подростков прозрачность, системы мониторинга и продуманная реакция с учетом возраста.

Мы убеждены, что многоуровневый подход с обеспечением эшелонированной защиты⁠ имеет решающее значение для создания более безопасных систем ИИ. Данные политики основаны на нашем внутреннем опыте, однако они не отражают в полной мере внутренние правила или меры безопасности OpenAI.

Дальнейшие шаги

Мы выпускаем эти политики в качестве открытого исходного кода через сообщество моделей ROOST (ROOST Model Community), чтобы стимулировать сотрудничество и доработку. Чтобы внести свой вклад, оставить отзыв или поделиться дополнительными правилами безопасности для подростков, посетите репозиторий RMC на GitHub.

Разработчики и организации могут адаптировать эти политики под свои конкретные приложения, переводить их на разные языки и расширять для охвата новых областей риска. Со временем мы надеемся, что это послужит более надежной и общей основой для внедрения политик безопасности в системах ИИ.

Чтобы начать работу с gpt-oss-safeguard, загрузите ее с платформы Hugging Face.

Полный текст статьи читайте на OpenAI