Меры по укреплению доверия для искусственного интеллекта: материалы семинара

Читать документ
A pastel digital landscape painting featuring rolling green hills beneath a pink and blue sky, with fields in the foreground blending soft tones of yellow, lavender, and coral.

Аннотация

Базовые модели в конечном итоге могут создать ряд предпосылок для подрыва государственной безопасности: несчастные случаи, непреднамеренная эскалация, непреднамеренный конфликт, распространение оружия и вмешательство в дипломатические процессы — это лишь немногие пункты из длинного списка. Семинар по мерам укрепления доверия в сфере искусственного интеллекта, организованный группой по геополитике в OpenAI и Лабораторией рисков и безопасности в Беркли при Калифорнийском университете, собрал представителей различных заинтересованных сторон для совместного поиска инструментов и стратегий по смягчению потенциальных рисков, создаваемых базовыми моделями для международной безопасности. Зародившись во время холодной войны, меры по укреплению доверия (МУД) представляют собой действия, которые снижают враждебность, предотвращают эскалацию конфликтов и укрепляют доверие между сторонами. Гибкость МУД делает их ключевым инструментом для реагирования на стремительные изменения в сфере базовых моделей. Участники выделили следующие МУД, которые напрямую применимы к базовым моделям и подробно описаны в настоящих материалах конференции: 1. горячие линии для кризисных ситуаций; 2. обмен информацией об инцидентах; 3. карточки моделей, прозрачности и систем; 4. происхождение контента и водяные знаки; 5. совместное командное тестирование (red teaming) и настольные игры (учения); 6. совместное использование наборов данных и оценок. Поскольку большинство разработчиков базовых моделей являются негосударственными организациями, многие МУД потребуют вовлечения более широкого круга заинтересованных сторон. Эти меры могут быть реализованы как лабораториями искусственного интеллекта, так и профильными государственными структурами.

Авторы отчета в порядке вклада

Сара Шокер (OpenAI)*, Эндрю Редди (Калифорнийский университет в Беркли)**

Авторы отчета в алфавитном порядке

Сара Баррингтон (Калифорнийский университет в Беркли)

Руби Бут (Лаборатория рисков и безопасности в Беркли)

Майлз Брандаж (OpenAI)

Хусанджот Чахал (OpenAI)

Майкл Депп (Центр новой американской безопасности)

Билл Дрексел (Центр новой американской безопасности)

Ридвик Гупта (Калифорнийский университет в Беркли)

Марина Фаваро (Anthropic)

Джейк Хекла (Калифорнийский университет в Беркли)

Алан Хики (OpenAI)

Маргарита Конаев (Центр безопасности и новых технологий)

Кирти Кумар (Калифорнийский университет в Беркли)

Натан Ламберт (Hugging Face)

Эндрю Лон (Центр безопасности и новых технологий)

Каллен О'Киф (OpenAI)

Назнин Раджани (Hugging Face)

Майкл Селлитто (Anthropic)

Роберт Трейгер (Центр управления искусственным интеллектом)

Лия Уокер (Калифорнийский университет в Беркли)

Алекса Весенер (Институт безопасности и технологий)

Джессика Янг (Microsoft)

Все авторы внесли существенный вклад в документ, поделившись своими идеями в качестве участников семинара, написав текст статьи и/или предоставив редакционные отзывы и направления работы. Первые два автора указаны в порядке вклада, а остальные авторы — в алфавитном порядке. Некоторые участники семинара пожелали остаться анонимными. Заявления в этом документе не отражают точку зрения организаций каких-либо авторов. По вопросам, касающимся этого документа, обращайтесь к Саре Шокер по адресу sshoker@openai.com и к Эндрю Редди по адресу areddie@berkeley.edu.

*Значительный вклад, включая написание текста, предоставление подробных материалов для статьи, исследование, организацию семинара и определение направления работы над документом.

**Значительный вклад, включая предоставление подробных материалов для статьи, исследование, организацию семинара и определение направления работы над документом.

Полный текст статьи читайте на OpenAI