GPT‑Red: Раскрытие потенциала самосовершенствования для повышения надежности

Обучение эффективных автоматизированных агентов безопасности для тестирования на проникновение (ред-тиминг) с целью повышения надежности.

Читать научную работу

Сводка

Проблема

  • Red-teaming (стресс-тестирование на безопасность) имеет решающее значение для обнаружения уязвимостей и повышения надежности наших моделей. Однако текущие подходы не масштабируются, создавая узкое место.

  • Широко используемые оценки надежности уже исчерпали свой потенциал в наших новейших моделях.

  • Нам необходимо разработать методы, которые позволят масштабировать безопасность и выравнивание (alignment) соразмерно с ростом возможностей моделей.

Что мы сделали

  • Мы обучили GPT‑Red — модель автоматизированного red-teaming, которая масштабирует нашу способность находить уязвимости, чтобы мы могли устранять их до широкого развертывания.

  • GPT‑Red является мощным инструментом для red-teaming, и наши предыдущие модели крайне уязвимы к ее атакам с внедрением промптов (prompt injection).

  • Мы используем GPT‑Red для состязательного (adversarial) обучения GPT‑5.6, делая ее гораздо более устойчивой к внедрениям промптов.

  • Мы продолжим масштабировать этот подход наряду с человеческим и сторонним red-teaming, многоуровневыми средствами защиты и мониторингом в реальном времени.

Системы ИИ регулярно сталкиваются со сторонними данными через браузеры, подключенные приложения, локальные файлы и другие инструменты. Эти возможности необходимы для выполнения реальных задач, но они также создают больше возможностей для злоумышленников влиять на поведение модели. Например, третья сторона может внедрить тщательно составленную инструкцию — призванную обманом заставить модель выгрузить конфиденциальные данные на внешний сервер — в электронное письмо, веб-страницу, ответ инструмента или репозиторий кода.

Человеческий red-teaming является важнейшей частью нашей работы по безопасности, помогая нам выявлять эти уязвимости до развертывания и внедрять надлежащие средства защиты. Но силами только людей этот процесс трудно масштабировать. Проектирование и проведение таких учений требуют много времени, что ограничивает скорость, с которой мы можем выявлять новые типы сбоев и интегрировать их в более надежные механизмы защиты. Кроме того, хотя эти учения дают ценные примеры успешных атак, они не могут обеспечить тот объем и разнообразие состязательных данных, которые необходимы для повышения устойчивости моделей посредством обучения.

Поспевать за все более мощными моделями требует соответствующего масштабирования red-teaming. С этой целью мы обучали автоматизированные внутренние модели для red-teaming, которые выявляют уязвимости до развертывания и генерируют атаки в процессе обучения модели для повышения ее надежности. Мы верим, что автоматизированный red-teaming открывает ключевую форму самосовершенствования для обеспечения безопасности: использование современных моделей для непосредственного повышения безопасности будущих моделей.

GPT‑Red является кульминацией этих усилий и нашей на сегодняшний день лучшей автоматизированной моделью безопасности для red-teaming. Подобно тому, как специалисты-люди создают атаки, модель работает над достижением цели путем отправки промпта, наблюдения за реакцией моделей GPT и итераций. Мы обучили GPT‑Red на вычислительных мощностях, сопоставимых с нашими крупнейшими этапами постобучения в OpenAI, — беспрецедентный объем вычислений был выделен исключительно на улучшение безопасности.

Мы напрямую интегрируем GPT‑Red в процесс обучения наших производственных моделей. В результате GPT‑5.6 Sol стала нашей самой устойчивой к внедрению промптов моделью на сегодняшний день: на нашем самом сложном бенчмарке прямого внедрения промптов она демонстрирует в 6 раз меньше сбоев по сравнению с нашей лучшей производственной моделью всего четырехмесячной давности. Масштабируемость нашего подхода заставляет нас с энтузиазмом ждать еще более впечатляющих результатов в будущем, поскольку мы продолжаем обучать более мощные инструменты для red-teaming.

Примеры диалогов с внедренными промптами

Обучение GPT‑Red посредством самоигрывания (self-play)

GPT‑Red обучается с использованием метода обучения с подкреплением на основе самоигрывания, при котором модель и набор разнообразных LLM-защитников обучаются одновременно на широком спектре сценариев red-teaming. GPT‑Red получает вознаграждение за провоцирование реального сбоя (например, успешное внедрение промпта), в то время как модели-защитники вознаграждаются за отражение атаки и выполнение своих первоначальных задач. По мере того как защитники становятся более надежными, GPT‑Red вынуждена находить более мощные и разнообразные атаки.

Для поддержки обучения через самоигрывание мы создаем обширный набор реалистичных сценариев, в которых могут быть внедрены промпты. Каждая среда имеет модель угроз, которая определяет, чем может управлять GPT‑Red и что считается успешной атакой. Например, GPT‑Red может управлять частью локального файла, баннером веб-страницы, телом электронного письма или выводом инструмента.

По завершении обучения GPT‑Red представляет собой очень сильного злоумышленника: она способна взломать практически все модели, против которых ее выставляют, включая как внутренние, так и производственные модели вплоть до GPT‑5.5 включительно. После завершения обучения GPT‑Red мы использовали ее для генерации внедрений промптов при обучении GPT‑5.6, в результате чего модель стала крайне устойчивой к атакам GPT‑Red.

Мы держим GPT‑Red отдельно от развертываемых нами моделей. Это позволяет оградить вредоносные возможности, которые мы целенаправленно закладываем в GPT‑Red, от попадания в руки злоумышленников, одновременно обеспечивая надежность наших производственных моделей.

Насколько сильна GPT‑Red?

GPT‑Red демонстрирует высокую эффективность против популяции моделей-защитников и сценариев red-teaming, на которых она обучалась. Мы также оцениваем, полезна ли модель в качестве универсального агента red-teaming для повышения безопасности в OpenAI в целом. Для этого мы проверяем эффективность GPT‑Red в новых средах безопасности и на целевых моделях.

Сначала мы оцениваем способность GPT‑Red обобщать знания на новые сценарии red-teaming, используя реплицированную версию арены непрямого внедрения промптов от Дземьяна и др. (2025). В этом испытании как специалисты-люди, так и GPT‑Red независимо друг от друга предложили атаки против GPT‑5.1 наборе заранее определенных сред. Эти сценарии и цели red-teaming отличаются от тех, которые использовались для обучения GPT‑Red. GPT‑Red достигает значительно более высоких показателей успешности атак, добиваясь успеха в 84% сценариев по сравнению с 13% у людей.

GPT‑Red превосходно справляется с ролью автоматизированного агента red-teaming. GPT‑Red способна генерировать успешные атаки против GPT‑5.1 в значительно большем числе сценариев, чем специалисты-люди, на арене непрямого внедрения промптов от Дземьяна и др. (2025) с использованием внутреннего зеркала.

Реалистичные кейсы red-teaming

Высшей проверкой для инструмента red-teaming является способность достигать целевых вредоносных целей против реальных агентских систем при неполном знании базовой модели системы и структуры фреймворка. Наш первый эксперимент в этой обстановке противопоставил GPT‑Red торговому автомату на базе ИИ в офисе OpenAI (аналогично Project Vend), созданному компанией Andon Labs. Мы предоставили GPT‑Red описание системы и возможность отправлять атаки и наблюдать за вызовами инструментов от симулированного агента, что очень близко имитирует развертывание в реальном мире. Проведя итерации атак, GPT‑Red развернула свою атаку против рабочего агента, достигнув всех трех своих вредоносных целей:

  • изменение цены дорогого товара в наличии до минимально разрешенной в $0,50;
  • заказ нового товара стоимостью от $100 и предложение его за $0,50;, а также
  • отмена заказа другого клиента.

Мы раскрыли эти уязвимости, и в настоящее время активно тестируются новые средства защиты.

Visual showing a GPT-Red attack-search process against a Vendy-style autonomous vending machine agent.

GPT‑Red способна взломать работающего автономного агента по имени Vendy, который управляет торговым автоматом. GPT‑Red смогла заставить производственного агента изменить цены дорогих товаров на дешевые и отменить заказы других клиентов, сначала проведя тестирование в симуляции, а затем перенеся атаки на работающего агента.

Мы также используем GPT‑Red для атаки на агента Codex CLI (на базе GPT‑5.4 mini) наборе из 10 отложенных сценариев эксфильтрации данных. Мы сравниваем модель с базовой линией на основе промптов GPT‑5.5, чтобы изучить влияние нашей процедуры обучения на производительность red-teaming на отложенных данных. GPT‑Red оказывается как более эффективной — в том смысле, что она может успешно заставлять агента эксфильтровать конфиденциальные данные в большем числе сценариев — так и более токеноэффективной.

GPT‑Red более эффективна и результативна при взломе работающих агентов codex. Мы проводим тестирование против агента codex на базе GPT‑5.4 Mini на пользовательском наборе из 10 задач по эксфильтрации данных.

Повышение надежности с помощью GPT‑Red

Конечная цель GPT‑Red — повышение надежности наших моделей. За последние шесть месяцев мы обучили последовательно более мощные модели red-teaming (предшественники GPT‑Red) с использованием возрастающих вычислительных мощностей и применяли эти модели при обучении каждой последующей производственной модели начиная с GPT‑5.3. Со временем каждый последующий релиз GPT становился все более надежным.

В качестве примера можно привести раннюю версию GPT‑Red, которая обнаружила новый класс атак прямого внедрения промптов, известных как атаки «Fake Chain-of-Thought» (фальшивая цепочка рассуждений). Эти атаки достигали показателей успешности более 95% на GPT‑5.1, но теперь этот показатель составляет менее 10% для GPT‑5.6 Sol. Аналогичным образом, несколько наших бенчмарков непрямого внедрения промптов, нацеленных на атаки в инструментах разработчика и веб-серфинге, были исчерпаны нашей новейшей моделью (>97% точности).

Устойчивость к самой GPT‑Red также существенно возросла. В широком спектре сред для проверки надежности показатели успешности атак GPT‑Red монотонно снижались с течением времени. В нашем новейшем релизе модели GPT‑5.6 Sol дает сбои лишь на 0,05% прямых внедрений промптов от GPT‑Red.

Продолжая масштабировать обучение с помощью самоигрывания для внедрения промптов, мы обнаружили новые угрозы, способные взламывать существующие модели. Тем не менее, наше масштабирование также помогло существенно повысить устойчивость к этим атакам. Коэффициент успешности атак рассчитывается как средняя успешность попыток по всем попыткам GPT‑Red в отложенных средах.

Надежность при сохранении высокой производительности

Модель может казаться более безопасной, если она отклоняет больше запросов или теряет в функциональности. Модель, которая делает меньше, естественно, сложнее атаковать, но это не та устойчивость, которая приносит пользу.

Мы тщательно оцениваем как общие передовые возможности, так и специально разработанные нами задачи на избыточные отказы. Мы обнаруживаем, что все базовые возможности остаются неизменными, в то время как устойчивость значительно возрастает. Это говорит о том, что прирост устойчивости обусловлен лучшим противодействием вредоносным инструкциям, а не некорректным использованием инструментов или отказом от выполнения легитимных запросов по умолчанию.

Следующие шаги

ИИ-агенты уже используются для расширения возможностей наших моделей нового поколения. Мы верим, что с помощью GPT-Red мы начали задействовать аналогичный маховик безопасности, когда модели сегодняшнего дня могут использоваться для того, чтобы сделать модели завтрашнего дня более устойчивыми, согласованными и заслуживающими доверия. Мы продолжим масштабировать вычислительные мощности и данные, одновременно совершенствуя алгоритмы, чтобы обучать будущие версии GPT-Red, которые будут сильнее сегодняшней модели. В свою очередь, эти модели помогут сделать будущие релизы GPT еще более безопасными.

Автор

OpenAI

Полный текст статьи читайте на OpenAI