Сотрудничество с американским CAISI и британским AISI для создания более безопасных систем ИИ

Обзор нашего сотрудничества с исследовательскими организациями и органами по стандартизации США и Великобритании в целях безопасного внедрения ИИ.

Abstract gradient of deep and light blue with a diagonal sweep of soft purple, evoking trust, security, and forward motion.

Мы гордимся тем, что продолжаем расширять границы возможностей и безопасности искусственного интеллекта. Разработка и внедрение безопасного и полезного ИИ лежат в основе нашей миссии — гарантировать, что общий искусственный интеллект (AGI) принесет пользу всему человечеству. Ключевую роль в этом играет наша работа с исследовательскими организациями и органами по стандартизации США и Великобритании, которые также стремятся обеспечить безопасное развертывание систем ИИ для своих граждан.

Мы стали одной из первых компаний, заключивших добровольные соглашения как с Американским центром стандартов и инноваций в области ИИ (CAISI), так и с Британским институтом безопасности ИИ (UK AISI). Эти партнерства отражают наше убеждение в том, что разработка передового ИИ должна происходить в тесном сотрудничестве с союзными государствами, обладающими глубокой экспертизой в области машинного обучения, национальной безопасности и метрологии.

Сегодня мы делимся примерами того, как это добровольное сотрудничество помогло дополнить наши существующие подходы к безопасности и принести реальные результаты: совместное тестирование на проникновение (red-teaming) для защиты от биологических рисков, сквозное тестирование продуктов на предмет уязвимостей, а также оперативные циклы обратной связи для устранения выявленных недочетов. Результатом стали более надежные механизмы защиты широко используемых продуктов на базе ИИ, повышение планки для всей индустрии, рост популярности ИИ и демонстрация того, как правительства и бизнес могут совместно оценивать и повышать безопасность систем ИИ.

Совместная работа над безопасным внедрением ИИ-агентов

Более года OpenAI сотрудничает с CAISI в целях оценки возможностей моделей OpenAI в сфере кибербезопасности, химической и биологической безопасности, а также в других областях, затрагивающих национальную безопасность. Недавно мы расширили наше партнерство, включив в него новые задачи по обеспечению безопасности продуктов, и совместно с CAISI провели тестирование на проникновение для агентских систем ИИ от OpenAI. В ходе нового формата сотрудничества, состоявшегося в июле, специалисты OpenAI и CAISI изучили возможности привлечения внешних экспертов для поиска и устранения уязвимостей в таких агентских системах, как ChatGPT Agent от OpenAI.

Это сотрудничество с CAISI стало предварительным шагом в новую сферу тестирования агентских систем на проникновение. Мы намерены продолжать совместную работу в этой области, опираясь на другие уровни мер безопасности при развертывании, включая наши собственные внутренние тесты.

Экспертная группа CAISI, объединяющая специалистов в области кибербезопасности и безопасности ИИ-агентов, занялась исследованием и выявлением новых уязвимостей в этих системах. Организация получила ранний доступ к ChatGPT Agent, что помогло экспертам составить первоначальное представление об архитектуре системы, а впоследствии они провели тестирование уже выпущенного продукта.

В ходе непрерывного тестирования специалисты CAISI выявили две новые уязвимости в ChatGPT Agent, которые при определенных обстоятельствах могли позволить изощренному злоумышленнику обойти нашу защиту, получить удаленный контроль над компьютерными системами, к которым у агента был доступ в рамках сеанса, и успешно выдать себя за пользователя на других веб-сайтах, куда тот выполнял вход.

Из-за мер безопасности, заложенных в дизайн продукта OpenAI, в CAISI сначала посчитали обнаруженные уязвимости неэксплуатируемыми и потому бесполезными для злоумышленников. Однако после дальнейшего анализа эксперты CAISI нашли способ обойти защитные механизмы систем OpenAI, объединив традиционные киберуязвимости с атакой по перехвату ИИ-агента. Разработанная CAISI концептуальная атака (proof-of-concept) успешно обошла различные защитные механизмы на базе ИИ, что привело к реализации полноценной цепочки эксплойтов с коэффициентом успешности примерно 50%. Междисциплинарный подход команды CAISI позволил им создать сложную цепочку атак, объединившую традиционные программные уязвимости с уязвимостями искусственного интеллекта. Кроме того, продемонстрировав, как системы ИИ могут служить ценным инструментом для тестирования безопасности, эксперты CAISI задействовали сам ChatGPT Agent для поиска этих уязвимостей.

Об этих атаках было немедленно сообщено в OpenAI, и компания устранила их в течение одного рабочего дня.

Это добровольное сотрудничество между OpenAI и CAISI продолжает нашу годичную работу в области исследований и оценки. Обнаружение этих уязвимостей потребовало от CAISI новаторского подхода к объединению нескольких эксплойтов и комбинации атак для компрометации систем ИИ с использованием методов как кибербезопасности, так и машинного обучения. На стыке безопасности ИИ-агентов и традиционной кибербезопасности возникнет необходимость выработки новых передовых практик, и партнерство с CAISI, направленное на совершенствование этой стороны науки тестирования и безопасности систем ИИ, уже приносит прямую пользу конечным пользователям.

Наши средства защиты агентских систем также учитывают опыт, полученный в ходе предыдущих масштабных инвестиций в защиту от биологических рисков, включая серию партнерских проектов по тестированию этих средств с третьими сторонами, в том числе с UK AISI.

Сотрудничество в сфере биобезопасности

В рамках продолжающегося сотрудничества с UK AISI в мае специалисты института приступили к тестированию на проникновение наших средств защиты от биологических рисков (согласно определениям внутренней политики OpenAI), включая защиту в ChatGPT Agent и GPT‑5. Это не привязано к какому-то конкретному релизу, а представляет собой постоянное взаимодействие, направленное на непрерывное повышение эффективности нашего комплекса защитных мер.

В рамках этого партнерства экспертам UK AISI был предоставлен глубокий доступ к нашим системам, подкрепленный специальной работой OpenAI по обеспечению более гибкой настройки и безопасности. Это включало:

  • Непубличные прототипы наших систем защиты
  • Варианты моделей «только для помощи» (helpful-only) с отключенными определенными ограничениями
  • Внутренние правила и рекомендации OpenAI, касающиеся биологических рисков
  • Доступ к цепочке рассуждений (chain of thought) внутренних моделей мониторинга безопасности OpenAI для более эффективного выявления уязвимостей
  • Выборочное отключение некоторых средств смягчения последствий и принудительного контроля во время тестирования для проверки подкомпонентов системы

Междисциплинарная команда UK AISI, объединившая экспертов в области методов тестирования ИИ на проникновение и биобезопасности, поставила перед собой задачу найти универсальные методы обхода защиты (jailbreaks) против биологических угроз в системах OpenAI. Специалисты UK AISI применили глубокие технические навыки тестирования, такие как использование особенностей проектирования систем для создания атак, что заложило прочный фундамент для успешного сотрудничества.

Это партнерство охватило все аспекты развернутой системы: от ответов отдельных моделей до сценариев использования продукта в целом. Процесс носил итеративный характер: UK AISI тестировала прототипы систем OpenAI, OpenAI в ответ усиливала защиту, после чего цикл тестирования повторялся.

Ключевую роль в этой работе играл оперативный цикл обратной связи. Начиная с мая и вплоть до выпуска ChatGPT Agent в июле и GPT‑5 в августе, команды UK AISI и OpenAI регулярно проводились рабочие встречи примерно раз в неделю, включая прямые консультации с техническими специалистами для более глубокого понимания и решения конкретных проблем. Кроме того, компания OpenAI создала специальные пользовательские конфигурации для тестирования на основе результатов, полученных от UK AISI.

В ходе этого процесса UK AISI обнаружила, а OpenAI проанализировала более дюжины подробных отчетов об уязвимостях. Некоторые из них привели к исправлению продуктов на уровне инженерии, другие — к корректировке внедрения регламентов безопасности, а часть потребовала от OpenAI проведения целенаправленного обучения для улучшения определенных аспектов классификаторов. Например, OpenAI повысила надежность стека мониторинга, усовершенствовав его и проверив на устойчивость к набору универсальных методов обхода защиты, выявленных UK AISI как в ходе ручного тестирования на проникновение, так и с помощью автоматизированных атак. Кроме того, компонент сквозного тестирования доказал свою особую эффективность. OpenAI внесла ряд улучшений в конфигурацию продукта для устранения уязвимостей конфигурации, обнаруженных UK AISI, при которых вредоносный контент мог вводиться или извлекаться без срабатывания модерации.

Наше тесное сотрудничество означало, что UK AISI получила доступ к непубличным инструментам (например, к цепочкам рассуждений монитора), конфиденциальной информации (в частности, к деталям устройства защитных механизмов), а также возможность работать при отключенной системе блокировки учетных записей OpenAI. Обычным злоумышленникам такие ресурсы и условия недоступны. Это позволило провести тестирование более эффективно и дало возможность UK AISI обнаружить сбои, с которыми злоумышленникам без такого доступа и технической экспертизы столкнуться было бы значительно труднее.

По оценке UK AISI, механизмы защиты всей системы модерации существенно укрепились за время совместной работы. Ближе к концу периода интенсивных итераций поиск универсальных атак, способных обйти всю систему модерации, требовал применения изощренных методов и отправки большого числа флагов модерации в процессе разработки. Это означает, что система мониторинга использования, скорее всего, зафиксирует попытки любого злоумышленника разработать эксплойт, что в конечном итоге приведет к блокировке на платформе.

Описанная работа дополняет другие внутренние и внешние стресс-тесты наших средств биологической защиты, включая масштабное тестирование (более 5000 часов) в рамках трех различных кампаний по проверке защитных механизмов, а также взаимодействие с другими сторонними партнерами. (Подробнее см. в системных картах GPT‑5 и ChatGPT Agent.)

Почему это важно

  • Эти инициативы представляют собой примеры наиболее глубокого государственно-частного партнерства по оценке реальных передовых систем ИИ на предмет безопасности и защиты от злоупотреблений, и мы надеемся, что они послужат многообещающей моделью для всей отрасли.
  • Сотрудничество с государственными ведомствами позволяет нам задействовать их экспертизу в области национальной безопасности и одновременно делиться с правительством текущим состоянием передовых технологий. Такой практический опыт, в свою очередь, помогает государственным органам разрабатывать научно обоснованные передовые практики, которые ускоряют инновации и безопасность во всей индустрии ИИ.
  • Это партнерство привело к значительным улучшениям безопасности в некоторых из наиболее широко используемых систем ИИ в мире.
  • Независимый экспертный анализ безопасности наших систем помогает нам выявлять проблемы, которые мы могли бы упустить, а также повышает прозрачность и доверие к нашим технологиям.
  • Постоянное сотрудничество может быть более глубоким и приносить больше пользы, чем разовые оценки перед запуском.

Взгляд в будущее

Техническая экспертиза CAISI и UK AISI в области искусственного интеллекта и национальной безопасности сыграла важнейшую роль в этом сотрудничестве и привела к значительным улучшениям наших средств защиты и безопасности продуктов. Тесные технические партнерства с организациями, обладающими как ресурсами, так и стимулами для тщательной оценки систем ИИ, укрепляют уверенность в безопасности наших технологий.

Автор

OpenAI

Полный текст статьи читайте на OpenAI