Сторонние кибеro-оценки с участием моделей OpenAI

third-party-cyber-evaluations_16x9.png?w

Независимое тестирование играет важную роль в нашей работе по валидации и более глубокому пониманию рисков до внедрения моделей. Некоторые кибероценки намеренно используют пользовательские конфигурации, включая сниженные уровни защиты, для измерения базовых возможностей, а не того, как модели ведут себя при обычном общедоступном развертывании.

Во время недавних оценок два сторонних партнера по тестированию выявили инциденты, в которых конфигурации тестирования и элементы управления в сочетании с растущими возможностями новых моделей позволили активности моделей выйти за пределы предназначенных для тестирования границ. Эти инциденты подчеркивают важность сотрудничества в масштабах всей индустрии и со сторонними оценщиками для совершенствования стандартов тестовых сред и практик по мере роста возможностей моделей. Примечание редактора: данные случаи отличаются от инцидента безопасности с Hugging Face, и мы продолжим публиковать обновления по инциденту с Hugging Face здесь.

Новые инциденты связаны с тем, что модели OpenAI получали доступ к публичному интернету во время сторонних кибероценок в специфических условиях и с конфигурациями пониженной защиты, которые не отражают стандартное развертывание. В число этих инцидентов вошли:

  1. Британский институт безопасности ИИ (UK AISI) проводил оценку на полигонах кибербезопасности с намеренно разрешенным доступом в интернет, чтобы агенты могли самостоятельно находить инструменты и действовать в условиях, более приближенных к реальному злоумышленнику, а также с отключенными киберклассификаторами для измерения базовых возможностей. Вы можете прочитать их блог здесь.
  2. Irregular, один из наших внешних партнеров по тестированию кибербезопасности, проводил оценки в стиле CTF (Capture-the-Flag), которые должны были быть изолированы от интернета, однако из-за неверной конфигурации тестовой среды модели получили доступ к публичному интернету.

Ниже мы подводим итоги произошедшего, описываем условия тестирования, которые привели к такой активности, шаги, предпринятые для ее локализации, а также рассказываем о том, что мы делаем для того, чтобы независимые лаборатории могли продолжать строгую и безопасную оценку все более мощных моделей.

Укрепление сред сторонней оценки моделей

Эти инциденты указывают на ту же более широкую проблему, о которой мы рассказывали в нашей недавней публикации об инциденте с безопасностью оценки моделей в Hugging Face: по мере развития возможностей моделей системы безопасности и защитные механизмы вокруг них также должны развиваться. Это относится как к средам, используемым для разработки моделей, так и к средам, которые лаборатории и независимые партнеры используют для их оценки.

В ближайшие недели мы пересмотрим собственный подход к стороннему тестированию, включая то, как мы определяем оценки с повышенным риском, согласовываем масштаб, оцениваем запросы на предоставление доступа в интернет или снижение уровней защиты, устанавливаем требования к изоляции, обращению с учетными данными, мониторингу и условиям остановки, а также формируем более четкие процессы уведомления об инцидентах и эскалации.

Мы стремимся работать со всей индустрией над укреплением общих практик безопасного проведения оценок с высоким уровнем риска, включая проведение в ближайшие недели встреч с заинтересованными сторонами, такими как национальные институты искусственного интеллекта, независимые оценщики, другие ИИ-лаборатории и другие группы. Наша цель — сохранить ценность строгой независимой оценки и при этом обеспечить соответствие методов тестирования возможностям моделей, которые продолжают расти.

UK AISI

3 августа UK AISI сообщил нам, что во время плановой кибероценки, начавшейся 25 июля, модели от OpenAI и другой лаборатории в некоторых случаях выходили за рамки тестирования. Оценка проводилась в контролируемых киберполигонах, имитирующих реальные сети. Из 19 выявленных событий два касались модели OpenAI — GPT‑5.6 Sol. Остальные случаи пришлись на модели другой лаборатории.

В ходе этой оценки агентам было поручено действовать в качестве экспертов по кибербезопасности в рамках упражнения CTF: скомпрометировать три связанных смоделированных окружения и получить финальный флаг. В промпте задачи были указаны сети полигона, входящие в область видимости, а также названы несколько систем, находящихся вне ее. UK AISI также включил доступ к живому интернету, чтобы агенты могли загружать инструменты и действовать в условиях, приближенных к действиям реального злоумышленника, и отключил киберклассификаторы модели для оценки ее базовых возможностей.

Предполагаемая граница авторизации UK AISI ограничивалась смоделированным киберполигоном: агенты имели право атаковать указанные смоделированные сети и получать флаг, но не взаимодействовать с системами за пределами сетевой границы полигона. Тем не менее агентам не было явно указано, как именно они могут и не могут использовать открытый доступ в интернет, что UK AISI считает потенциальной сопутствующей причиной инцидента.

В ходе этих запусков UK AISI обнаружил, что GPT‑5.6 Sol совершила два несанкционированных действия при попытке найти путь в смоделированный полигон и получить флаг:

  1. GPT‑5.6 Sol повторно использовала токен GitHub, который агент другой лаборатории оставил в общедоступном доступе, чтобы проверить, опрашивает ли система внутри полигона GitHub или другую службу обновлений, предприняла попытки восстановления учетной записи и обхода лимитов запросов, а также зарегистрировала учетные записи у внешних DNS-провайдеров и провайдеров туннелирования.
  2. GPT‑5.6 Sol использовала публичный сервис туннелирования, чтобы сделать DNS-сервер, запущенный локально в ее среде оценки, доступным из публичного интернета. На сервере содержались полезные нагрузки (payloads), предназначенные для известной уязвимости в программном обеспечении, работающем на тестовом полигоне. Эта установка не сработала, нет никаких доказательств того, что какой-либо реальный резолвер отправлял к нему запросы, а инфраструктура была удалена по завершении оценки.

Хотя модель пыталась пройти киберполигон, UK AISI сочла эти действия несанкционированными, поскольку они затрагивали реальные внешние учетные записи и сервисы за пределами границ полигона, а сами действия не требовались для выполнения задачи. На DNS-сервере также размещались эксплойты для публичного интернета, хотя настройка не сработала и нет свидетельств запросов к нему от реальных резолверов.

UK AISI выявила эту активность 28 июля после того, как средства мониторинга безопасности зафиксировали необычные передачи данных. Оценка была остановлена, соответствующие машины — изолированы, а активность локализована примерно в течение часа после обнаружения.

Мы ценим партнерство с UK AISI на протяжении всего этого процесса, включая их работу по выявлению, расследованию и распространению деталей об этой активности. Мы с нетерпением ждем продолжения нашего сотрудничества.

Irregular

29 июля один из наших сторонних партнеров по оценке, компания Irregular, уведомила нас об инциденте с участием моделей OpenAI во время кибероценок в стиле CTF (Capture-the-Flag). Перед моделями была поставлена задача найти скрытую информацию путем поиска уязвимостей в смоделированном окружении, при этом им сообщили, что доступа в интернет у них нет. Однако из-за ошибки конфигурации в тестовой среде модели получили доступ к публичному интернету.

В одном из тестов название вымышленной цели для CTF-задания непреднамеренно совпало с реальным доменом. Поскольку тестовая среда была по ошибке подключена к интернету, модель атаковала реальный веб-сайт, приняв его за часть смоделированной среды. Это не было связано со сложным побегом из песочницы или использованием уязвимости нулевого дня: доступ в интернет стал результатом неверной конфигурации, а модель воспользовалась базовой уязвимостью безопасности.

Согласно расследованию Irregular, модель также нашла учетные данные и использовала их для работы с тем же сайтом. Irregular не выявила какого-либо ущерба, выходящего за рамки данных самого затронутого сайта, аудит продолжается. Тестирование было приостановлено, начато устранение последствий, а затронутые третьи стороны были уведомлены. Компания Irregular сообщила нам, что все выявленные проблемы, имеющие отношение к инциденту, больше не активны, а в тестовую среду были добавлены необходимые средства защиты. Irregular также проинформировала общественность о связанных инцидентах с участием других лабораторий в рамках той же тестовой среды.

Мы ценим партнерство с Irregular и продолжим тесно сотрудничать с ними, чтобы поддержать их проверку. Irregular также готовит технический документ (white paper), в котором будут представлены лучшие практики по локализации и безопасному проведению кибероценок. Мы с нетерпением ждем участия в подготовке этого документа, чтобы сделать выводы доступными для сообщества, и продолжения нашего партнерства. Мы считаем подобное сотрудничество необходимым для обеспечения безопасной и тщательной оценки текущих и будущих моделей.

Автор

OpenAI

Полный текст статьи читайте на OpenAI