Комплексный подход к обнаружению нежелательного контента в реальных условиях

Мы представляем комплексный подход к созданию надежной и полезной системы классификации естественного языка для модерации контента в реальных условиях. Успех такой системы зависит от цепочки тщательно спроектированных и выполненных шагов, включая разработку таксономий контента и инструкций по разметке, контроль качества данных, конвейер активного обучения для выявления редких событий, а также различные методы повышения надежности модели и предотвращения переобучения. Наша система модерации обучена обнаруживать широкий спектр категорий нежелательного контента, включая контент сексуального характера, язык вражды, проявления насилия, селфхарм и домогательства. Этот подход применим к самым разным таксономиям контента и может использоваться для создания высококачественных классификаторов контента, превосходящих готовые модели.
Авторы
Полный текст статьи читайте на OpenAI
