Риски передовых систем ИИ и готовность к ним
Для обеспечения безопасности высокопроизводительных систем ИИ мы разрабатываем наш подход к готовности к катастрофическим рискам, включая формирование команды по обеспечению готовности и запуск конкурса.

В рамках нашей миссии по созданию безопасного общего искусственного интеллекта (AGI) мы со всей серьезностью подходим ко всему спектру рисков безопасности, связанных с ИИ — от систем, которыми мы располагаем сегодня, до отдаленных рубежей суперинтеллекта. В июле мы присоединились к другим ведущим лабораториям ИИ, взяв на себя ряд добровольных обязательств по содействию безопасности, защищенности и доверию к ИИ. Эти обязательства охватывают целый ряд областей риска, включая в первую очередь передовые риски, которым был посвящен саммит Великобритании по безопасности ИИ. В рамках нашего вклада в работу саммита мы подробно описали наш прогресс в области обеспечения безопасности передового ИИ, включая работу в рамках наших добровольных обязательств.
Наш подход к обеспечению готовности
Мы верим, что передовые модели ИИ, которые превзойдут возможности самых совершенных из существующих сегодня моделей, способны принести пользу всему человечеству. Но они также несут в себе все более серьезные риски. Управление катастрофическими рисками, исходящими от передового ИИ, потребует ответов на такие вопросы, как:
- Насколько опасны передовые системы ИИ при их злонамеренном использовании — как сегодня, так и в будущем?
- Как мы можем создать надежную основу для мониторинга, оценки, прогнозирования и защиты от опасных возможностей передовых систем ИИ?
- Если веса наших передовых моделей ИИ будут похищены, как злоумышленники могут решить ими воспользоваться?
Нам необходимо убедиться, что у нас есть понимание и инфраструктура, необходимые для обеспечения безопасности высокопроизводительных систем ИИ.
Наша новая команда по обеспечению готовности
Чтобы минимизировать эти риски по мере дальнейшего совершенствования моделей ИИ, мы создаем новую команду под названием «Готовность» (Preparedness). Под руководством Александра Мадря (Aleksander Madry) команда по обеспечению готовности будет тесно увязывать оценку возможностей, тестирование и внутренний «краснейший тиминг» (red teaming) для передовых моделей — от тех, которые мы разрабатываем в ближайшем будущем, до систем с возможностями уровня AGI. Команда будет помогать отслеживать, оценивать, прогнозировать и защищать от катастрофических рисков в нескольких категориях, в том числе:
- Индивидуализированное убеждение
- Кибербезопасность
- Химические, биологические, радиологические и ядерные (ХБРЯ) угрозы
- Автономное самовоспроизведение и адаптация (ARA)
Миссия команды по обеспечению готовности также включает в себя разработку и поддержание Политический регламента разработки с учетом рисков (Risk-Informed Development Policy, RDP). Наша RDP подробно описывает наш подход к разработке строгих оценок возможностей и мониторинга передовых моделей, созданию спектра защитных мер и формированию структуры управления для подотчетности и контроля на протяжении всего процесса разработки. RDP призвана дополнить и расширить нашу существующую работу по минимизации рисков, которая способствует безопасности и выравниванию новых, высокопроизводительных систем как до, так и после их развертывания.
Присоединяйтесь к нам
Хотите работать в направлении обеспечения готовности? Мы нанимаем исключительные таланты с самым разным техническим бэкграундом в нашу команду по обеспечению готовности, чтобы раздвинуть границы возможностей наших передовых моделей ИИ.
Конкурс по обеспечению готовности
Чтобы выявить менее очевидные области для беспокойства (и сформировать команду!), мы также запускаем конкурс AI Preparedness Challenge, направленный на предотвращение катастрофических злоупотреблений. Мы предоставим кредиты на API на сумму 25 000 долларов США каждому из 10 лучших участников, опубликуем новаторские идеи и работы, а также будем искать кандидатов в команду по обеспечению готовности среди финалистов этого конкурса.
Обновление: Конкурс завершен. Ниже приведена информация о поданных заявках и основных выводах.
Победители конкурса по обеспечению готовности
В рамках нашего направления по работе с «неизвестными неизвестными» из структуры обеспечения готовности (Preparedness Framework) Команда по обеспечению готовности выделила по 25 тыс. долларов США в виде кредитов на API для десяти лучших заявок на участие в конкурсе. Эти заявки были направлены на выявление уникальных, но при этом правдоподобных областей риска для передового ИИ. Мы получили сотни заявок на полудюжине языков и рады объявить ниже имена десяти победителей. Это мероприятие помогло нам выявить новые типы рисков, чтобы мы могли улучшить наши превентивные стратегии тестирования и минимизации.
Мы изучили и оценили каждую заявку по критериям технической строгости, уникальности, масштаба потенциального ущерба и ясности. Десять лучших заявок, некоторые из которых перечислены ниже, сочетали в себе продуманные идеи с доказательствами концепции (proof of concept) и подчеркивали преимущества своего подхода по сравнению с методами, не использующими инструменты на базе ИИ
- Провоцирование финансового кризиса в стратегически важной стране — Клаудия Бьянкотти (Claudia Biancotti)
- Выявление частной информации, обсуждаемой или обнародованной в общественных местах — Крис Канди (Chris Cundy)
- Увеличение вероятности обратного проектирования (реверс-инжиниринга) секретной или конфиденциальной информации — Джордж Дэвис (George Davis)
- Создание препятствий для доступа граждан к медицинской помощи — Мато Гудель (Mato Gudelj)
- Выявление целей для шантажа и мошенничества — Коннор Хитон (Connor Heaton)
- Выведение из строя самолетов путем доступа к радиочастотам и нарушения траекторий полета — Джоэл Ипполит (Joel Hypolite)
- Проведение атак с внедрением промптов (prompt injection) для получения опасных ответов — Даниэль Юль (Daniel Julh)
- Проведение и масштабирование кибератак, выводящих из строя компьютеры жертв с требованием выкупа за восстановление функций — Джун Кокацу (Jun Kokatsu)
- Вмешательство в дозировку лекарств для пациентов — Чжэньчжэнь Чжань (Zhenzhen Zhan)
Оценивая конкурсные работы, мы заметили сходство в темах, которые участники определили как ключевые угрозы. Примерно 70% участников подчеркнули потенциал моделей OpenAI по усилению возможностей злоумышленников в области убеждения. Эти участники подробно описали модели угроз, включающие онлайн-радикализацию, поляризацию и политическое влияние. В настоящее время мы проводим исследования влияния ИИ на убедительность и с нетерпением ждем возможности в ближайшее время поделиться дополнительной информацией с сообществом. Большое спасибо всем, кто принял участие в конкурсе — было представлено множество отличных работ.
Источники
Автор
Полный текст статьи читайте на OpenAI
