Меры по укреплению доверия для искусственного интеллекта: материалы семинара

Аннотация
Базовые модели в конечном итоге могут создать ряд предпосылок для подрыва государственной безопасности: несчастные случаи, непреднамеренная эскалация, непреднамеренный конфликт, распространение оружия и вмешательство в дипломатические процессы — это лишь немногие пункты из длинного списка. Семинар по мерам укрепления доверия в сфере искусственного интеллекта, организованный группой по геополитике в OpenAI и Лабораторией рисков и безопасности в Беркли при Калифорнийском университете, собрал представителей различных заинтересованных сторон для совместного поиска инструментов и стратегий по смягчению потенциальных рисков, создаваемых базовыми моделями для международной безопасности. Зародившись во время холодной войны, меры по укреплению доверия (МУД) представляют собой действия, которые снижают враждебность, предотвращают эскалацию конфликтов и укрепляют доверие между сторонами. Гибкость МУД делает их ключевым инструментом для реагирования на стремительные изменения в сфере базовых моделей. Участники выделили следующие МУД, которые напрямую применимы к базовым моделям и подробно описаны в настоящих материалах конференции: 1. горячие линии для кризисных ситуаций; 2. обмен информацией об инцидентах; 3. карточки моделей, прозрачности и систем; 4. происхождение контента и водяные знаки; 5. совместное командное тестирование (red teaming) и настольные игры (учения); 6. совместное использование наборов данных и оценок. Поскольку большинство разработчиков базовых моделей являются негосударственными организациями, многие МУД потребуют вовлечения более широкого круга заинтересованных сторон. Эти меры могут быть реализованы как лабораториями искусственного интеллекта, так и профильными государственными структурами.
Авторы отчета в порядке вклада
Сара Шокер (OpenAI)*, Эндрю Редди (Калифорнийский университет в Беркли)**
Авторы отчета в алфавитном порядке
Сара Баррингтон (Калифорнийский университет в Беркли)
Руби Бут (Лаборатория рисков и безопасности в Беркли)
Майлз Брандаж (OpenAI)
Хусанджот Чахал (OpenAI)
Майкл Депп (Центр новой американской безопасности)
Билл Дрексел (Центр новой американской безопасности)
Ридвик Гупта (Калифорнийский университет в Беркли)
Марина Фаваро (Anthropic)
Джейк Хекла (Калифорнийский университет в Беркли)
Алан Хики (OpenAI)
Маргарита Конаев (Центр безопасности и новых технологий)
Кирти Кумар (Калифорнийский университет в Беркли)
Натан Ламберт (Hugging Face)
Эндрю Лон (Центр безопасности и новых технологий)
Каллен О'Киф (OpenAI)
Назнин Раджани (Hugging Face)
Майкл Селлитто (Anthropic)
Роберт Трейгер (Центр управления искусственным интеллектом)
Лия Уокер (Калифорнийский университет в Беркли)
Алекса Весенер (Институт безопасности и технологий)
Джессика Янг (Microsoft)
Все авторы внесли существенный вклад в документ, поделившись своими идеями в качестве участников семинара, написав текст статьи и/или предоставив редакционные отзывы и направления работы. Первые два автора указаны в порядке вклада, а остальные авторы — в алфавитном порядке. Некоторые участники семинара пожелали остаться анонимными. Заявления в этом документе не отражают точку зрения организаций каких-либо авторов. По вопросам, касающимся этого документа, обращайтесь к Саре Шокер по адресу sshoker@openai.com и к Эндрю Редди по адресу areddie@berkeley.edu.
*Значительный вклад, включая написание текста, предоставление подробных материалов для статьи, исследование, организацию семинара и определение направления работы над документом.
**Значительный вклад, включая предоставление подробных материалов для статьи, исследование, организацию семинара и определение направления работы над документом.
Полный текст статьи читайте на OpenAI
