Необходимость прозрачности в передовых системах искусственного интеллекта (Frontier AI)

A building with a set of columns

Разработка передовых систем искусственного интеллекта нуждается в большей прозрачности для обеспечения общественной безопасности и подотчетности компаний, создающих эту мощную технологию. ИИ развивается стремительно. В то время как индустрия, правительства, академические круги и другие участники работают над выработкой согласованных стандартов безопасности и комплексных методов оценки — процесс, который может занять от месяцев до лет, — нам необходимы промежуточные меры, гарантирующие, что создание очень мощного ИИ будет осуществляться безопасно, ответственно и прозрачно.

Поэтому мы предлагаем целевую структуру прозрачности, которая может применяться на федеральном, государственном или международном уровне и распространяется только на крупнейшие системы и разработчиков ИИ, одновременно устанавливая четкие требования к раскрытию информации о мерах безопасности.

Наш подход сознательно избегает излишней предписательности. Мы понимаем, что по мере дальнейшего развития науки об ИИ любые регуляторные усилия должны оставаться гибкими и ненавязчивыми. Это не должно препятствовать инновациям в сфере ИИ и замедлять нашу способность реализовывать преимущества ИИ, включая разработку лекарств, спасающих жизни, быстрое предоставление общественных благ и выполнение важнейших функций национальной безопасности. Жесткие государственные стандарты были бы особенно контрпродуктивными, учитывая, что методы оценки устаревают в течение нескольких месяцев из-за темпов технологических изменений.

Минимальные стандарты прозрачности ИИ

Ниже приведены основные принципы, которые, по нашему мнению, должны лечь в основу политики прозрачности ИИ:

  • Ограничение сферы применения крупнейшими разработчиками моделей: Прозрачность ИИ должна применяться только к крупнейшим разработчикам передовых моделей, которые создают наиболее мощные системы, причем передовые модели отличаются сочетанием пороговых значений вычислительной мощности, стоимости вычислений, результатов оценки, годового дохода и расходов на НИОКР. Во избежание избыточной нагрузки на экосистему стартапов и небольших разработчиков, создающих модели с низким риском для национальной безопасности или причинения катастрофического ущерба, структура должна включать соответствующие исключения для небольших разработчиков. Мы приветствуем мнение стартап-сообщества о том, какими должны быть эти пороговые значения. Внутренне мы обсуждали следующие примеры возможных пороговых значений: годовой доход на уровне от 100 миллионов долларов; либо расходы на НИОКР или капитальные затраты на уровне от 1 миллиарда долларов в год. Эти пороговые значения должны периодически пересматриваться по мере развития технологий и ландшафта индустрии.
  • Создание структуры безопасной разработки (Secure Development Framework): Требовать от разработчиков соответствующих передовых моделей наличия структуры безопасной разработки, в которой описывается, как они будут оценивать и снижать неоправданные риски, связанные с моделью. Эти риски должны включать создание химических, биологических, радиологических и ядерных угроз, а также риски, вызванные несогласованной автономией модели. Структуры безопасной разработки все еще остаются развивающимся инструментом безопасности, поэтому любое предложение должно стремиться к гибкости.
  • Публикация структуры безопасной разработки: Структура безопасной разработки должна быть раскрыта общественности с учетом разумных мер по редактированию конфиденциальной информации на общедоступном веб-сайте, зарегистрированном и поддерживаемом ИИ-компанией. Это позволит исследователям, правительствам и общественности быть в курсе развертываемых сегодня моделей ИИ. Раскрытие информации должно сопровождаться самосертификацией лаборатории о соблюдении условий опубликованной структуры безопасной разработки.
  • Публикация системной карты (System Card): Системные карты или другая документация должны суммировать процедуры тестирования и оценки, результаты и необходимые меры по минимизации рисков (с учетом надлежащего редактирования информации, которая может поставить под угрозу общественную безопасность или безопасность самой модели). Системная карта также должна быть публично опубликована при развертывании и обновляться в случае существенной доработки модели.
  • Защита информаторов путем запрета ложных заявлений: Прямо установить в качестве нарушения закона предоставление лабораторией ложных сведений о соблюдении ею своей структуры. Это уточнение создает четкое правовое нарушение, позволяющее применять существующие меры защиты информаторов и обеспечивающее концентрацию правоприменительных ресурсов именно на те лаборатории, которые допустили умышленное неправомерное поведение.
  • Стандарты прозрачности: Работоспособная система прозрачности ИИ должна иметь минимальный набор стандартов, чтобы она могла повысить безопасность и защиту населения, одновременно учитывая эволюционирующий характер разработки ИИ. Учитывая, что практика безопасности и защиты ИИ находится на ранних стадиях, а такие передовые разработчики, как Anthropic, активно исследуют передовой опыт, любая структура должна быть спроектирована с расчетом на развитие. Стандарты должны начинаться как гибкие, легкие требования, которые могут адаптироваться по мере формирования общего мнения о передовом опыте среди индустрии, государства и других заинтересованных сторон.

Этот подход к прозрачности проливает свет на передовой опыт индустрии в области безопасности и может помочь установить базовый уровень того, как ответственные лаборатории обучают свои модели, гарантируя, что разработчики соблюдают основные стандарты подотчетности, позволяя при этом общественности и лицам, принимающим решения, отличать ответственную практику от безответственной. Например, описываемая нами структура безопасной разработки похожа на собственную Политику ответственного масштабирования Anthropic и аналогичные документы ведущих лабораторий (Google DeepMind, OpenAI, Microsoft), каждая из которых уже внедрила похожие подходы при выпуске передовых моделей.Закрепление требования о прозрачности структуры безопасной разработки в законодательстве не только стандартизирует передовой опыт отрасли, не высекая его в камне, но и гарантирует, что эти раскрытия информации (которые в настоящее время являются добровольными) не будут отменены в будущем по мере того, как модели станут еще более мощными.

Мнения расходятся относительно того, могут ли и когда именно модели ИИ представлять катастрофические риски. Требования прозрачности к структурам безопасной разработки и системным картам могут помочь предоставить лицам, принимающим решения, доказательства, необходимые для определения того, требуется ли дальнейшее регулирование, а также предоставить общественности важную информацию об этой мощной новой технологии.

По мере совершенствования моделей у нас появляется беспрецедентная возможность ускорить научные открытия, здравоохранение и экономический рост. Без безопасного и ответственного развития единый катастрофический сбой может остановить прогресс на десятилетия. Наша предложенная структура прозрачности предлагает практический первый шаг: обеспечение публичной видимости практик безопасности при сохранении гибкости частного сектора для реализации преобразующего потенциала ИИ.

Полный текст статьи читайте на Anthropic