Дальнейшее развитие управления в сфере ИИ
OpenAI и другие ведущие лаборатории повышают безопасность, защищенность и надежность ИИ с помощью добровольных обязательств.

Иллюстрация: Джастин Джей Ван (Justin Jay Wang) × DALL·E
OpenAI и другие ведущие ИИ-лаборатории берут на себя ряд добровольных обязательств по повышению безопасности, защищенности и надежности ИИ-технологий и наших сервисов. Этот процесс, координируемый Белым домом, является важным шагом на пути к продвижению осмысленного и эффективного регулирования искусственного интеллекта как в США, так и во всем мире.
В рамках нашей миссии по созданию безопасного и приносящего пользу ОИИ (AGI) мы продолжим тестировать и дорабатывать конкретные практики управления, специально адаптированные для высокопроизводительных базовых моделей, подобных тем, которые мы создаем. Мы также продолжим инвестировать в исследования в областях, которые могут способствовать разработке нормативно-правовой базы, таких как методы оценки потенциально опасных возможностей ИИ-моделей.
«Политики по всему миру рассматривают возможность принятия новых законов для высокопроизводительных ИИ-систем. Сегодняшние обязательства вносят конкретные и практические наработки в это продолжающееся обсуждение. Это объявление является частью нашего постоянного сотрудничества с правительствами, организациями гражданского общества и другими участниками по всему миру в целях развития управления в сфере ИИ», — заявила Анна Маканжу (Anna Makanju), вице-президент по глобальным вопросам.
Добровольные обязательства в сфере ИИ
Ниже приведен список обязательств, которые компании берут на себя для содействия безопасной, защищенной и прозрачной разработке и использованию ИИ-технологий. Эти добровольные обязательства не противоречат действующим законам и нормативным актам и призваны способствовать развитию правовой и политической базы в области генеративного ИИ. Компании предполагают, что эти добровольные обязательства останутся в силе до тех пор, пока не вступят в силу нормативные акты, охватывающие по существу те же вопросы. Отдельные компании могут принимать на себя дополнительные обязательства помимо тех, что включены в данный список.
Сфера применения: Если в обязательствах упоминаются конкретные модели, они применяются только к генеративным моделям, которые в целом мощнее современного технологического рубежа отрасли (например, модели, которые в целом мощнее любых выпущенных в настоящее время моделей, включая GPT-4, Claude 2, PaLM 2, Titan, а в случае генерации изображений — DALL-E 2).
Безопасность
1) Взять на себя обязательство проводить внутреннее и внешнее тестирование на проникновение («краш-тестирование» / red-teaming) моделей или систем в таких областях, как нецелевое использование, риски для общества и угрозы национальной безопасности (включая биологические, кибернетические и другие аспекты безопасности).
Компании, принимающие это обязательство, понимают, что надежное красное тестирование имеет важное значение для создания успешных продуктов, обеспечения общественного доверия к ИИ и защиты от серьезных угроз национальной безопасности. Оценки безопасности и возможностей моделей, включая тестирование на проникновение, являются открытой областью научных исследований, и предстоит сделать еще многое. Компании обязуются развивать эту область исследований и разрабатывать многогранный, специализированный и детальный режим красного тестирования, в том числе с привлечением независимых профильных экспертов, для всех крупных публичных релизов новых моделей, подпадающих под действие этого соглашения. При разработке этого режима они обеспечат уделение значительного внимания следующим аспектам:
- Биологические, химические и радиологические риски, такие как способы, с помощью которых системы могут снизить барьеры для разработки, проектирования, приобретения или использования оружия
- Кибервозможности, такие как способы, с помощью которых системы могут содействовать обнаружению уязвимостей, их эксплуатации или оперативному использованию, помня о том, что такие возможности могут иметь и полезные оборонительные применения и их целесообразно включать в систему
- Последствия взаимодействия систем и использования инструментов, включая способность управлять физическими системами
- Способность моделей делать копии самих себя или «самовоспроизводиться»
- Риски для общества, такие как предвзятость и дискриминация
Для поддержки этих усилий компании, принимающие данное обязательство, обязуются развивать текущие исследования в области безопасности ИИ, в том числе в отношении интерпретируемости процессов принятия решений ИИ-систем и повышения устойчивости ИИ-систем к нецелевому использованию. Кроме того, компании обязуются публично раскрывать информацию о своих процедурах красного тестирования и обеспечения безопасности в отчетах о прозрачности (описанных ниже).
2) Работать над общим доступом к информации между компаниями и правительствами в отношении рисков доверия и безопасности, опасных или эмерджентных возможностей, а также попыток обойти средства защиты
Компании, принимающие это обязательство, признают важность обмена информацией, общих стандартов и передового опыта для тестирования на проникновение и повышения доверия и безопасности ИИ. Они обязуются создать или присоединиться к форуму или механизму, посредством которого они смогут разрабатывать, совершенствовать и внедрять общие стандарты и передовые практики обеспечения безопасности передового ИИ, такие как Рамочная программа управления рисками ИИ NIST (NIST AI Risk Management Framework) или будущие стандарты, связанные с красным тестированием, безопасностью и социальными рисками. Форум или механизм может способствовать обмену информацией о достижениях в области передовых возможностей и возникающих рисках и угрозах, таких как попытки обойти средства защиты, а также способствовать созданию технических рабочих групп по приоритетным областям, вызывающим озабоченность. В этой работе компании будут тесно взаимодействовать с правительствами, в том числе с правительством США, гражданским обществом и академическими кругами, в зависимости от обстоятельств.
Защищенность
3) Инвестировать в средства обеспечения кибербезопасности и защиты от внутренних угроз для охраны проприетарных и неизданных весов моделей
Компании, принимающие это обязательство, будут рассматривать неизданные веса ИИ-моделей для моделей, подпадающих под действие соглашения, как ключевую интеллектуальную собственность своего бизнеса, особенно в отношении кибербезопасности и рисков внутренних угроз. Это включает в себя ограничение доступа к весам моделей лицами, чьи должностные функции этого требуют, и создание надежной программы обнаружения внутренних угроз, соответствующей мерам защиты, предоставляемым для их наиболее ценной интеллектуальной собственности и коммерческой тайны. Кроме того, это требует хранения весов и работы с ними в соответствующей безопасной среде для снижения риска несанкционированного выпуска.
4) Стимулировать стороннее обнаружение и сообщение о проблемах и уязвимостях
Компании, принимающие это обязательство, признают, что ИИ-системы могут продолжать иметь слабости и уязвимости даже после проведения тщательного тестирования на проникновение. Они обязуются устанавливать для систем, подпадающих под действие соглашения, системы вознаграждений, конкурсы или призы для стимулирования ответственного раскрытия информации об уязвимостях, таких как небезопасное поведение, или включать ИИ-системы в свои существующие программы поиска уязвимостей (bug bounty).
Доверие
5)Разрабатывать и внедрять механизмы, позволяющие пользователям понимать, создано ли аудио- или визуальное контент с помощью ИИ, включая надежное отслеживание происхождения, нанесение водяных знаков или то и другое для созданного ИИ аудио- или визуального контента
Компании, принимающие это обязательство, признают важность того, чтобы люди могли понимать, когда аудио- или визуальный контент сгенерирован ИИ. Для достижения этой цели они соглашаются разрабатывать надежные механизмы, включая системы проверки происхождения и/или водяных знаков для аудио- или визуального контента, созданного любой из их общедоступных систем в рамках области применения, представленных после разработки системы водяных знаков. Они также разработают инструменты или API для определения того, был ли конкретный контент создан с помощью их системы. Аудиовизуальный контент, который легко отличить от реальности или который разработан таким образом, чтобы его можно было легко распознать как созданный с помощью ИИ-системы компании (например, голоса ИИ-ассистентов по умолчанию), выходит за рамки этого обязательства. Водяной знак или данные о происхождении должны включать идентификатор сервиса или модели, создавшей контент, но они не обязательно должны содержать какую-либо идентифицирующую пользователя информацию. В более общем плане компании, принимающие это обязательство, обязуются работать с коллегами по отрасли и органами по стандартизации над созданием технической основы, помогающей пользователям отличать аудио- или визуальный контент, созданный пользователями, от контента, сгенерированного ИИ.
6) Публично сообщать о возможностях, ограничениях и областях допустимого и недопустимого использования моделей или систем, включая обсуждение социальных рисков, таких как влияние на справедливость и предвзятость
Компании, принимающие это обязательство, признают, что пользователи должны понимать известные возможности и ограничения ИИ-систем, которые они используют или с которыми взаимодействуют. Они обязуются публиковать отчеты по всем новым значительным публичным релизам моделей в рамках области применения. Эти отчеты должны включать проведенные оценки безопасности (в том числе в таких областях, как опасные возможности, в той мере, в какой это целесообразно раскрывать публично), значительные ограничения производительности, имеющие последствия для областей надлежащего использования, обсуждение влияния модели на социальные риски, такие как справедливость и предвзятость, а также результаты состязательного тестирования, проведенного для оценки пригодности модели к развертыванию.
7) Уделять приоритетное внимание исследованиям социальных рисков, создаваемых ИИ-системами, включая предотвращение вредной предвзятости и дискриминации, а также защиту конфиденциальности
Компании, принимающие это обязательство, признают важность предотвращения распространения вредных предрассудков и дискриминации со стороны ИИ-систем. Компании обязуются в целом расширять возможности команд по обеспечению доверия и безопасности, продвигать исследования в области безопасности ИИ, развивать конфиденциальность, защищать детей и работать над активным управлением рисками ИИ, чтобы можно было реализовать его преимущества.
8) Разрабатывать и внедрять передовые ИИ-системы для решения величайших проблем общества
Компании, принимающие это обязательство, соглашаются поддерживать исследования и разработку передовых ИИ-систем, которые могут помочь в решении величайших проблем общества, таких как смягчение последствий изменения климата и адаптация к нему, раннее выявление и профилактика рака, а также борьба с киберугрозами. Компании также обязуются поддерживать инициативы, способствующие образованию и обучению студентов и работников для извлечения выгоды из преимуществ ИИ, а также помогающие гражданам понять природу, возможности, ограничения и влияние этой технологии.
Вы можете ознакомиться с информационным бюллетенем Белого домаздесь.
Автор
Полный текст статьи читайте на OpenAI
