Согласование принципов обеспечения безопасности детей

Наряду с другими ведущими компаниями в сфере искусственного интеллекта мы обязуемся внедрять надежные меры по обеспечению безопасности детей при разработке, развертывании и поддержке технологий генеративного ИИ. Эта новая инициатива, возглавляемая Thorn (некоммерческой организацией, занимающейся защитой детей от сексуального насилия) и All Tech Is Human (организацией, занимающейся совместным решением сложных проблем на стыке технологий и общества), направлена на снижение рисков, которые генеративный ИИ представляет для детей.
Это обязательство знаменует собой значительный шаг вперед в предотвращении неправомерного использования технологий ИИ для создания или распространения материалов с изображениями сексуального насилия над детьми (AIG-CSAM) и других форм сексуального насилия в отношении детей.
Будучи организацией, ориентированной на безопасность, мы сделали приоритетом внедрение строгих правил, проведение масштабного тестирования на проникновение (red teaming) и сотрудничество с внешними экспертами для обеспечения безопасности наших моделей. Правила Anthropic строго запрещают контент, который описывает, поощряет, поддерживает или распространяет любую форму сексуальной эксплуатации или надругательства над детьми. Если мы обнаруживаем такие материалы, мы сообщаем о них в Национальный центр по делам пропавших и эксплуатируемых детей (NCMEC). Важно отметить, что в настоящее время наши модели не имеют мультимодальных выходных данных, несмотря на то что они способны принимать изображения.
В рамках этой работы по обеспечению безопасности на этапе проектирования (Safety by Design) компания Anthropic привержена принципам безопасности по дизайну. Для обеспечения реальных действий Anthropic также берет на себя следующие обязательства по снижению рисков, вытекающие из этих принципов. Мы работаем над следующими направлениями:
Разработка
- Ответственный подход к выбору обучающих данных: избегать включения в обучение данных, которые имеют известный риск (согласно оценкам профильных экспертов) содержания CSAM и CSEM.
- Выявлять, удалять и сообщать о CSAM и CSEM в наших обучающих данных на этапе их загрузки.
- Проводить тестирование на проникновение (red teaming), включая структурированное, масштабируемое и последовательное стресс-тестирование наших моделей на предмет AIG-CSAM и CSEM.
- Определить конкретные правила работы с обучающими данными и разработки моделей.
- Запретить клиентам использовать наши модели для содействия сексуальному насилию над детьми.
Развертывание
- Выявлять оскорбительный и противоправный контент (CSAM, AIG-CSAM и CSEM) во входных и выходных данных.
- Предусмотреть возможности отправки пользователями жалоб, обратной связи или маркировки контента.
- Включить механизмы правоприменения.
- Предусмотреть сообщения о недопустимости запросов (солиситации) CSAM с использованием доступных инструментов.
- Внедрить поэтапное развертывание с мониторингом злоупотреблений на ранних стадиях перед широким запуском.
- Добавить раздел о безопасности детей в карточки наших моделей.
Поддержка
- При отправке отчетов в NCMEC использовать аннотирование файлов генеративного ИИ (Generative AI File Annotation).
- Обнаруживать, сообщать, удалять и предотвращать CSAM, AIG-CSAM и CSEM.
- Инвестировать в инструменты для защиты контента от манипуляций, созданных с помощью ИИ.
- Поддерживать высокое качество мер по снижению рисков.
- Запретить использование генеративного ИИ для введения людей в заблуждение с целью сексуального насилия над детьми.
- Использовать возможности разведки на основе открытых источников (OSINT) для понимания того, как злоумышленники потенциально могут использовать наши платформы, продукты и модели в корыстных целях.
Более подробную информацию о принципах, которые мы и другие организации подписали, можно найти в официальном документе: Safety by Design for Generative AI: Preventing Child Sexual Abuse.
Полный текст статьи читайте на Anthropic
