Комплексный подход к обнаружению нежелательного контента в реальных условиях

A_Holistic_Approach_to_Undesired_Content
Читать научную работу

Мы представляем комплексный подход к созданию надежной и полезной системы классификации естественного языка для модерации контента в реальных условиях. Успех такой системы зависит от цепочки тщательно спроектированных и выполненных шагов, включая разработку таксономий контента и инструкций по разметке, контроль качества данных, конвейер активного обучения для выявления редких событий, а также различные методы повышения надежности модели и предотвращения переобучения. Наша система модерации обучена обнаруживать широкий спектр категорий нежелательного контента, включая контент сексуального характера, язык вражды, проявления насилия, селфхарм и домогательства. Этот подход применим к самым разным таксономиям контента и может использоваться для создания высококачественных классификаторов контента, превосходящих готовые модели.

Авторы

Todor Markov, Chong Zhang, Sandhini Agarwal, Tyna Eloundou, Teddy Lee, Steven Adler, Angela Jiang, Lilian Weng

Полный текст статьи читайте на OpenAI