Обновление Moderation API с нашей новой мультимодальной моделью модерации

Мы представляем новую модель на базе GPT‑4o, которая эффективнее обнаруживает вредоносный текст и изображения, позволяя разработчикам создавать более надежные системы модерации.

Abstract painting of overlapping geometric shapes in pastel shades of orange, pink, purple, and blue, with a block-like pattern creating a layered, textured effect.

Сегодня мы представляем новую модель модерации, omni-moderation-latest, в Moderation API. Основанная на GPT‑4o, новая модель поддерживает как текстовые, так и визуальные входные данные и работает точнее нашей предыдущей модели, особенно с неанглоязычным контентом. Как и предыдущая версия, эта модель использует классификаторы OpenAI на базе GPT для оценки того, следует ли помечать контент в таких категориях, как «ненависть», «насилие» и «самоповреждение», а также добавляет возможность обнаружения новых категорий нарушений. Кроме того, она обеспечивает более детальный контроль над решениями по модерации благодаря калибровке вероятностных оценок, отражающих степень соответствия контента обнаруженной категории. Новая модель модерации доступна бесплатно для всех разработчиков через Moderation API.

С тех пор как мы впервые запустили Moderation API в 2022 году, объем и разнообразие контента, с которым должны справляться автоматизированные системы модерации, значительно выросли, особенно по мере того, как все больше ИИ-приложений достигли масштабного продакшна. Мы надеемся, что сегодняшние обновления помогут еще большим разработчикам воспользоваться последними исследованиями и инвестициями в наши системы безопасности.

Компании из самых разных секторов — от платформ социальных сетей и инструментов для повышения продуктивности до генеративных ИИ-платформ — используют Moderation API для создания более безопасных продуктов для своих пользователей. Например, Grammarly применяет Moderation API в качестве части защитных механизмов в своем ИИ-ассистенте для коммуникации, чтобы гарантировать безопасность и этичность результатов работы продукта. Аналогичным образом ElevenLabs использует Moderation API наряду с собственными решениями для сканирования контента, создаваемого их аудио-ИИ-продуктами, предотвращая и помечая материалы, нарушающие их политику.

Обновленная модель модерации включает в себя ряд важных улучшений:

  • Мультимодальная классификация вредоносного контента по шести категориям: новая модель может оценивать вероятность того, что изображение (само по себе или в сочетании с текстом) содержит вредоносный контент. На сегодняшний день это поддерживается для следующих категорий: насилие (violence и violence/graphic), самоповреждение (self-harm, self-harm/intent и self-harm/instruction) и материалы сексуального характера (sexual, но не sexual/minors). Остальные категории в настоящее время работают только с текстом, и мы работаем над расширением поддержки мультимодальности для других категорий в будущем.
  • Две новые текстовые категории вредоносного контента: новая модель может обнаруживать нарушения еще в двух категориях по сравнению с нашими предыдущими моделями: illicit, которая охватывает инструкции или советы о том, как совершить противоправное действие (например, фраза вроде «как совершить кражу в магазине»), и illicit/violent, которая охватывает аналогичные действия, но сопряженные с насилием.
  • Более точные оценки, особенно для неанглоязычного контента: в ходе тестирования на 40 языках по сравнению с предыдущей моделью наша новая модель продемонстрировала улучшение на 42% в рамках внутренней многоязычной оценки и показала рост результатов для 98% протестированных языков. Для языков с низким объемом ресурсов, таких как кхмерский или свати, улучшение составило 70%, а наибольший рост был зафиксирован для телугу (в 6,4 раза), бенгали (в 5,6 раза) и маратхи (в 4,6 раза). Хотя предыдущая модель обладала ограниченной поддержкой неанглоязычного контента, производительность новой модели на испанском, немецком, итальянском, польском, вьетнамском, португальском, французском, китайском, индонезийском и английском языках превосходит показатели производительности предыдущей модели даже для английского языка.
  • Откалиброванные оценки: теперь оценки новой модели более точно отражают вероятность того, что тот или иной контент нарушает соответствующие правила, и будут значительно более согласованными в будущих моделях модерации.

Системы модерации контента на основе ИИ помогают обеспечивать соблюдение правил платформы и снижают нагрузку на модераторов-людей, что имеет решающее значение для поддержания здоровья цифровых платформ. Именно поэтому, как и в случае с нашей предыдущей моделью, мы делаем новую модель модерации бесплатной для всех разработчиков через Moderation API с лимитами запросов, зависящими от уровня использования. Чтобы начать работу, ознакомьтесь с нашим руководством по Moderation API.

Авторы

Иэн Кивличен (Ian Kivlichan), Джастин Харриман (Justyn Harriman), Кэмерон Рэймонд (Cameron Raymond), Меган Шах (Meghan Shah), Шраман Рай Чаудхури (Shraman Ray Chaudhuri), Керен Гу-Лемберг (Keren Gu-Lemberg)

Выражение признательности

Фло Леони (Flo Leoni), Цзеци Юй (Jieqi Yu), Мадлен Бойд (Madelaine Boyd), Минсюань Ван (Mingxuan Wang), Нитанту Кудиге (Nithanth Kudige), Яо Чжоу (Yao Zhou), Андреа Валлоне (Andrea Vallone), Алек Хеляр (Alec Helyar), Эдмунд Вонг (Edmund Wong), Фрэнсис Чжан (Francis Zhang), Хади Салман (Hadi Salman), Энрике Понде де Оливейра Пинту (Henrique Ponde de Oliveira Pinto), Джойс Ли (Joyce Lee), Ник Престон (Nick Preston), Раул Пури (Raul Puri), Шибани Сантуркар (Shibani Santurkar), Линдси МакКаллум (Lindsay McCallum), Лехер Патхак (Leher Pathak), Эдвин Арбус (Edwin Arbus), Кевин Уиннери (Kevin Whinnery), Бет Гувер (Beth Hoover), Фредди Сулит (Freddie Sulit), Филиппо Расо (Filippo Raso), Кэри Хадсон (Cary Hudson), Дев Валладарес (Dev Valladares), Пранав Дешпанде (Pranav Deshpande), Сэм Тойзер (Sam Toizer), Лилиан Венг (Lilian Weng), Оуэн Кэмпбелл-Мур (Owen Campbell-Moore)

Полный текст статьи читайте на OpenAI