Повышение проверяемости при разработке искусственного интеллекта

Читать документ
Improving Verifiability

Иллюстрация: Джастин Джей Ван (Justin Jay Wang)

Мы приняли участие в подготовке отчета, созданного при участии широкого круга заинтересованных сторон, в котором насчитывается 58 соавторов из 30 организаций, включая Центр будущего интеллекта,  Mila,  Институт технологий и общества Шварца Рейсмана,  Центр углубленных исследований в области поведенческих наук и Центр безопасности и новых технологий. В этом отчете описывается 10 механизмов повышения проверяемости утверждений об искусственном интеллекте. Разработчики могут использовать эти инструменты для предоставления доказательств того, что системы ИИ безопасны, защищены, справедливы или обеспечивают конфиденциальность. Пользователи, директивные органы и гражданское общество могут использовать эти инструменты для оценки процессов разработки ИИ.

Хотя все большее число организаций формулируют этические принципы для руководства процессом разработки ИИ, людям со стороны бывает трудно проверить, действительно ли системы ИИ этих организаций отражают данные принципы на практике. Такая неопределенность затрудняет для заинтересованных сторон, таких как пользователи, директивные органы и гражданское общество, анализ заявлений разработчиков ИИ о свойствах систем ИИ и может подстегнуть погоню за конкурентным преимуществом в ущерб качеству, увеличивая социальные риски и угрозы. В отчете описываются существующие и потенциальные механизмы, которые могут помочь заинтересованным сторонам разобраться с такими вопросами, как:

  • Могу ли я (как пользователь) проверить заявления об уровне защиты конфиденциальности, гарантированном новой системой ИИ, которую я хотел бы использовать для машинного перевода конфиденциальных документов?
  • Могу ли я (как регулятор) проследить шаги, которые привели к аварии по вине автономного транспортного средства? С какими стандартами следует сопоставлять заявления компании — разработчика беспилотников о безопасности?
  • Могу ли я (как ученый) проводить беспристрастные исследования рисков, связанных с крупномасштабными системами ИИ, если у меня нет вычислительных ресурсов индустрии?
  • Могу ли я (как разработчик ИИ) убедиться, что мои конкуренты в определенной области разработки ИИ будут следовать передовым практикам, а не идти на ухищрения ради получения преимущества?

10 механизмов, выделенных в отчете, перечислены ниже вместе с рекомендациями, направленными на продвижение каждого из них. (Подробнее о том, как эти механизмы поддерживают проверяемость заявлений, а также соответствующие оговорки относительно наших выводов см. в отчете.)

Институциональные механизмы и рекомендации

  1. Независимый аудит (аудит третьей стороной). Коалиция заинтересованных сторон должна сформировать целевую группу для изучения вариантов проведения и финансирования стороннего аудита систем ИИ.
  2. Учения по моделированию угроз (Red teaming). Организации, занимающиеся разработкой ИИ, должны проводить учения по поиску уязвимостей для оценки рисков, связанных с разрабатываемыми ими системами, а также делиться передовым опытом и инструментами.
  3. Выплаты за обнаружение предвзятости и проблем безопасности. Разработчики ИИ должны запустить пилотные программы вознаграждений за поиск предвзятости и уязвимостей безопасности в системах ИИ, чтобы стимулировать широкое экспертное обсуждение и усилить контроль за ними.
  4. Обмен информацией об инцидентах с ИИ. Разработчики ИИ должны активнее делиться информацией об инцидентах, в том числе через совместные каналы связи.

Программные механизмы и рекомендации

  1. Журналы аудита (Audit trails). Организации по стандартизации должны работать совместно с академическим сообществом и индустрией над созданием требований к журналам аудита для критически важных приложений на базе ИИ.
  2. Интерпретируемость. Организации, разрабатывающие ИИ, и финансирующие структуры должны поддерживать исследования в области интерпретируемости систем ИИ с акцентом на помощь в оценке рисков и проведении аудита.
  3. Машинное обучение с сохранением конфиденциальности. Разработчики ИИ должны создавать, распространять и использовать наборы инструментов для обеспечения конфиденциальности при машинном обучении, включающие метрики производительности в соответствии с общепринятыми стандартами.

Аппаратные механизмы и рекомендации

  1. Безопасное аппаратное обеспечение для машинного обучения. Индустрия и научное сообщество должны объединить усилия для разработки функций аппаратной безопасности для ускорителей ИИ или иным образом сформировать передовые практики использования защищенного оборудования (включая защищенные анклавы на стандартном оборудовании) в контексте машинного обучения.
  2. Высокоточное измерение вычислительной мощности. Одна или несколько лабораторий ИИ должны подробно оценить объем вычислительных мощностей, задействованных в отдельном проекте, и рассказать об извлеченных уроках относительно возможностей более широкого внедрения таких методов.
  3. Вычислительная поддержка академических кругов. Правительственные фонды должны существенно увеличить финансирование ресурсов вычислительной мощности для исследователей из академической среды, чтобы повысить способность этих исследователей проверять заявления индустрии.

Мы и наши соавторы продолжим исследования этих механизмов, а OpenAI планирует внедрить некоторые из них в будущем. Мы надеемся, что этот отчет послужит толчком к содержательному диалогу, и мы с нетерпением ждем обсуждения дополнительных институциональных, программных и аппаратных механизмов, которые могут оказаться полезными для обеспечения надежной разработки ИИ. Мы призываем всех, кто заинтересован в сотрудничестве по этим вопросам, связаться с авторами-корреспондентами и посетить веб-сайт отчета.

Авторы отчета, равный вклад

Майлз Брандаж (Miles Brundage) (OpenAI)Шахар Авин (Shahar Avin) (Центр изучения экзистенциальных рисков, Центр будущего интеллекта им. Левералхама)Жасмин Ван (Jasmine Wang) (Mila, Монреальский университет)Хейдн Белфилд (Haydn Belfield) (Центр изучения экзистенциальных рисков, Центр будущего интеллекта им. Левералхама)Гретхен Крюгер (Gretchen Krueger) (OpenAI)

Авторы отчета, в порядке убывания вклада

Джиллиан Хадфилд (Gillian Hadfield) (OpenAI, Университет Торонто, Институт технологий и общества Шварца Рейсмана)Хейди Хлааф (Heidy Khlaaf) (Adelard)Цзинъин Ян (Jingying Yang) (Партнерство по искусственному интеллекту)Хелен Тонер (Helen Toner) (Центр безопасности и новых технологий)Рут Фонг (Ruth Fong) (Оксфордский университет)Теган Махарадж (Tegan Maharaj) (Mila, Монреальская политехническая школа)Пан Вей Ко (Pang Wei Koh) (Стэнфордский университет)Сара Хукер (Sara Hooker) (Google Brain)Джейд Люн (Jade Leung) (Институт будущего человечества)Эндрю Траск (Andrew Trask) (Оксфордский университет)Эмма Блюмке (Emma Bluemke) (Оксфордский университет)Джонатан Лебенсольд (Jonathan Lebensold) (Mila, Университет Макгилла)Каллен О'Киф (Cullen O«Keefe) (OpenAI)Марк Корен (Mark Koren) (Стэнфордский центр безопасности ИИ)Тео Риффель (Théo Ryffel) (Высшая нормальная школа [Париж])Джей Би Рубиновиц (JB Rubinovitz) (Remedy.AI)Тамай Бесироглу (Tamay Besiroglu) (Кембриджский университет)Федерика Каругати (Federica Carugati) (Центр углубленных исследований в области поведенческих наук)Джек Кларк (Jack Clark) (OpenAI)Питер Экерсли (Peter Eckersley) (Партнерство по искусственному интеллекту)Сара де Хаас (Sarah de Haas) (Google Research)Марица Джонсон (Maritza Johnson) (Google Research)Бен Лори (Ben Laurie) (Google Research)Алекс Ингерман (Alex Ingerman) (Google Research)Игорь Кравчук (Igor Krawczuk) (Федеральная политехническая школа Лозанны)Аманда Аскелл (Amanda Askell) (OpenAI)Росарио Каммарота (Rosario Cammarota) (Intel)Эндрю Лон (Andrew Lohn) (Корпорация RAND)Давид Крюгер (David Krueger) (Mila, Монреальская политехническая школа)Шарлотта Стикс (Charlotte Stix) (Эйндховенский технологический университет)Питер Хендерсон (Peter Henderson) (Стэнфордский университет)Логан Грэм (Logan Graham) (Оксфордский университет)Карина Прункл (Carina Prunkl) (Институт будущего человечества)Бьянка Мартин (Bianca Martin) (OpenAI)Элизабет Сегер (Elizabeth Seger) (Кембриджский университет)Ноа Зильберман (Noa Zilberman) (Оксфордский университет)Шон О Хейгейрти (Seán Ó hÉigeartaigh) (Центр будущего интеллекта им. Левералхама, Центр изучения экзистенциальных рисков)Френс Крёгер (Frens Kroeger) (Университет Ковентри)Гириш Састри (Girish Sastry) (OpenAI)Ребекка Каган (Rebecca Kagan) (Центр безопасности и новых технологий)Адриан Уэллер (Adrian Weller) (Кембриджский университет, Институт Алана Тьюринга)Брайан Це (Brian Tse) (Институт будущего человечества, Партнерство по искусственному интеллекту)Элизабет Барнс (Elizabeth Barnes) (OpenAI)Аллан Дафо (Allan Dafoe) (Институт будущего человечества)Пол Шарре (Paul Scharre) (Центр новой американской безопасности)Ариэль Герберт-Восс (Ariel Herbert-Voss) (OpenAI)Мартейн Рассер (Martijn Rasser) (Центр новой американской безопасности)Шагун Содхани (Shagun Sodhani) (Mila, Монреальский университет)Каррик Флинн (Carrick Flynn) (Center for Security and Emerging Technology)Томас Гилберт (Thomas Gilbert) (Калифорнийский университет в Беркли)Лиза Дайер (Lisa Dyer) (Партнерство по искусственному интеллекту)Саиф Хан (Saif Khan) (Центр безопасности и новых технологий)Йошуа Бенжио (Yoshua Bengio) (Mila, Монреальский университет)Маркус Андерлюнг (Markus Anderljung) (Институт будущего человечества)

Полный текст статьи читайте на OpenAI