Использование GPT‑4 для модерации контента
Мы используем GPT‑4 для разработки правил работы с контентом и принятия решений по его модерации. Это позволяет обеспечить более стабильную маркировку, ускорить обратную связь для доработки правил и снизить нагрузку на модераторов-людей.

Модерация контента играет ключевую роль в поддержании безопасности и здоровья цифровых платформ. Использование GPT‑4 в системе модерации позволяет многократно ускорить внедрение изменений в правила, сокращая цикл с месяцев до часов. Кроме того, GPT‑4 способен интерпретировать правила и нюансы в обширной документации по модерации контента и мгновенно адаптироваться к их обновлениям, что обеспечивает более последовательную маркировку. Мы считаем, что это открывает позитивное видение будущего цифровых платформ, где искусственный интеллект может помогать модерировать онлайн-трафик в соответствии со спецификой конкретной платформы и снижать психологическую нагрузку на большое число людей-модераторов. Любой пользователь, имеющий доступ к API OpenAI, может применить этот подход для создания собственной системы модерации на базе ИИ.
Проблемы модерации контента
Модерация контента требует кропотливого труда, чуткости, глубокого понимания контекста, а также быстрой адаптации к новым сценариям использования, что делает этот процесс сложным и трудоемким. Традиционно эта задача ложилась на плечи модераторов-людей, которым приходилось просматривать огромные объемы информации для фильтрации токсичных и вредоносных материалов, опираясь на помощь небольших специализированных моделей машинного обучения. Этот процесс по своей сути медленный и может вызывать у модераторов психологический стресс.
Использование больших языковых моделей
Мы изучаем возможность применения больших языковых моделей (LLM) для решения этих задач. Наши языковые модели, такие как GPT‑4, способны понимать естественный язык и генерировать его, что делает их применимыми для модерации контента. Модели могут принимать решения о модерации на основе предоставленных им регламентов.
С помощью этой системы процесс разработки и настройки правил модерации контента сокращается с нескольких месяцев до считанных часов.
- После написания правил эксперты формируют эталонный набор данных (golden set), выделяя небольшое количество примеров и размечая их в соответствии с политикой.
- Затем GPT‑4 читает правила и размечает этот же набор данных, не видя исходных ответов.
- Анализируя расхождения между оценками GPT‑4 и человека, эксперты могут попросить модель обосновать выставленные метки, проанализировать неоднозначность формулировок в правилах, устранить путаницу и внести необходимые уточнения. Шаги 2 и 3 можно повторять до тех пор, пока качество правил не станет удовлетворительным.
Этот итеративный процесс позволяет создавать доработанные правила контента, которые затем переводятся в формат классификаторов, что обеспечивает внедрение политики и масштабную модерацию.
При необходимости для обработки больших объемов данных в промышленных масштабах мы можем использовать прогнозы GPT‑4 для дообучения (fine-tuning) гораздо более компактной модели.
Эта простая, но мощная идея предлагает несколько существенных улучшений по сравнению с традиционными методами модерации контента:
- Более последовательная разметка. Правила работы с контентом постоянно эволюционируют и часто содержат множество деталей. Люди могут интерпретировать их по-разному, а некоторым модераторам требуется больше времени на освоение новых изменений, что приводит к расхождениям в разметке. В то же время языковые модели чувствительны к малейшим нюансам формулировок и могут мгновенно адаптироваться к обновлениям правил, обеспечивая пользователям единые стандарты взаимодействия с платформой.
- Ускоренная обратная связь. Цикл обновления правил — разработка новой политики, разметка и сбор отзывов от людей — зачастую является долгим и затянутым процессом. GPT‑4 позволяет сократить его до нескольких часов, обеспечивая более быструю реакцию на новые угрозы.
- Снижение психологической нагрузки. Постоянный контакт с вредоносным или оскорбительным контентом может приводить к эмоциональному выгоранию и стрессу у модераторов-людей. Автоматизация такого труда идет на пользу их психологическому благополучию.

Иллюстрация процесса использования GPT‑4 для модерации контента: от разработки правил до масштабного применения.
В отличие от Конституционного ИИ (Bai, et al. 2022), который в основном опирается на собственное внутреннее понимание модели о том, что является безопасным, а что нет, наш подход делает итерации правил контента для конкретной платформы гораздо более быстрыми и менее трудоемкими. Мы призываем специалистов по доверию и безопасности (Trust & Safety) опробовать этот процесс в модерации контента, поскольку любой пользователь с доступом к API OpenAI может повторить те же эксперименты уже сегодня.
Мы активно изучаем возможности дальнейшего повышения качества прогнозов GPT‑4 — например, путем внедрения цепочки рассуждений (chain-of-thought) или самокритики. Мы также экспериментируем со способами обнаружения неизвестных рисков и, вдохновляясь принципами Конституционного ИИ, стремимся использовать модели для выявления потенциально вредоносного контента на основе общих описаний того, что считается опасным. Полученные выводы в дальнейшем лягут в основу обновлений существующих правил или разработки политик для совершенно новых областей риска.
Ограничения
Оценки языковых моделей подвержены нежелательным предвзятостям, которые могли быть заложены в модель в процессе обучения. Как и в случае с любым приложением на базе ИИ, результаты и выходные данные требуют тщательного мониторинга, валидации и доработки при участии человека. Передавая языковым моделям те части процесса модерации, с которыми они могут справиться, и снижая степень вовлеченности людей, мы позволяем специалистам сосредоточиться на сложных граничных случаях, которые критически важны для совершенствования правил. Продолжая совершенствовать и развивать этот метод, мы по-прежнему привержены принципам прозрачности и намерены делиться своими наработками и успехами с сообществом.
Авторы
Благодарности
Ian Kivlichan, CJ Weinmann, Jeff Belgum, Todor Markov, Dave Willner
Полный текст статьи читайте на OpenAI
