GPT‑Red: Раскрытие потенциала самосовершенствования для повышения надежности
Обучение эффективных автоматизированных агентов безопасности для тестирования на проникновение (ред-тиминг) с целью повышения надежности.
Сводка
Проблема
Red-teaming (стресс-тестирование на безопасность) имеет решающее значение для обнаружения уязвимостей и повышения надежности наших моделей. Однако текущие подходы не масштабируются, создавая узкое место.
Широко используемые оценки надежности уже исчерпали свой потенциал в наших новейших моделях.
Нам необходимо разработать методы, которые позволят масштабировать безопасность и выравнивание (alignment) соразмерно с ростом возможностей моделей.
Что мы сделали
Мы обучили GPT‑Red — модель автоматизированного red-teaming, которая масштабирует нашу способность находить уязвимости, чтобы мы могли устранять их до широкого развертывания.
GPT‑Red является мощным инструментом для red-teaming, и наши предыдущие модели крайне уязвимы к ее атакам с внедрением промптов (prompt injection).
Мы используем GPT‑Red для состязательного (adversarial) обучения GPT‑5.6, делая ее гораздо более устойчивой к внедрениям промптов.
Мы продолжим масштабировать этот подход наряду с человеческим и сторонним red-teaming, многоуровневыми средствами защиты и мониторингом в реальном времени.
Системы ИИ регулярно сталкиваются со сторонними данными через браузеры, подключенные приложения, локальные файлы и другие инструменты. Эти возможности необходимы для выполнения реальных задач, но они также создают больше возможностей для злоумышленников влиять на поведение модели. Например, третья сторона может внедрить тщательно составленную инструкцию — призванную обманом заставить модель выгрузить конфиденциальные данные на внешний сервер — в электронное письмо, веб-страницу, ответ инструмента или репозиторий кода.
Человеческий red-teaming является важнейшей частью нашей работы по безопасности, помогая нам выявлять эти уязвимости до развертывания и внедрять надлежащие средства защиты. Но силами только людей этот процесс трудно масштабировать. Проектирование и проведение таких учений требуют много времени, что ограничивает скорость, с которой мы можем выявлять новые типы сбоев и интегрировать их в более надежные механизмы защиты. Кроме того, хотя эти учения дают ценные примеры успешных атак, они не могут обеспечить тот объем и разнообразие состязательных данных, которые необходимы для повышения устойчивости моделей посредством обучения.
Поспевать за все более мощными моделями требует соответствующего масштабирования red-teaming. С этой целью мы обучали автоматизированные внутренние модели для red-teaming, которые выявляют уязвимости до развертывания и генерируют атаки в процессе обучения модели для повышения ее надежности. Мы верим, что автоматизированный red-teaming открывает ключевую форму самосовершенствования для обеспечения безопасности: использование современных моделей для непосредственного повышения безопасности будущих моделей.
GPT‑Red является кульминацией этих усилий и нашей на сегодняшний день лучшей автоматизированной моделью безопасности для red-teaming. Подобно тому, как специалисты-люди создают атаки, модель работает над достижением цели путем отправки промпта, наблюдения за реакцией моделей GPT и итераций. Мы обучили GPT‑Red на вычислительных мощностях, сопоставимых с нашими крупнейшими этапами постобучения в OpenAI, — беспрецедентный объем вычислений был выделен исключительно на улучшение безопасности.
Мы напрямую интегрируем GPT‑Red в процесс обучения наших производственных моделей. В результате GPT‑5.6 Sol стала нашей самой устойчивой к внедрению промптов моделью на сегодняшний день: на нашем самом сложном бенчмарке прямого внедрения промптов она демонстрирует в 6 раз меньше сбоев по сравнению с нашей лучшей производственной моделью всего четырехмесячной давности. Масштабируемость нашего подхода заставляет нас с энтузиазмом ждать еще более впечатляющих результатов в будущем, поскольку мы продолжаем обучать более мощные инструменты для red-teaming.
Примеры диалогов с внедренными промптами
Обучение GPT‑Red посредством самоигрывания (self-play)
GPT‑Red обучается с использованием метода обучения с подкреплением на основе самоигрывания, при котором модель и набор разнообразных LLM-защитников обучаются одновременно на широком спектре сценариев red-teaming. GPT‑Red получает вознаграждение за провоцирование реального сбоя (например, успешное внедрение промпта), в то время как модели-защитники вознаграждаются за отражение атаки и выполнение своих первоначальных задач. По мере того как защитники становятся более надежными, GPT‑Red вынуждена находить более мощные и разнообразные атаки.
Для поддержки обучения через самоигрывание мы создаем обширный набор реалистичных сценариев, в которых могут быть внедрены промпты. Каждая среда имеет модель угроз, которая определяет, чем может управлять GPT‑Red и что считается успешной атакой. Например, GPT‑Red может управлять частью локального файла, баннером веб-страницы, телом электронного письма или выводом инструмента.
По завершении обучения GPT‑Red представляет собой очень сильного злоумышленника: она способна взломать практически все модели, против которых ее выставляют, включая как внутренние, так и производственные модели вплоть до GPT‑5.5 включительно. После завершения обучения GPT‑Red мы использовали ее для генерации внедрений промптов при обучении GPT‑5.6, в результате чего модель стала крайне устойчивой к атакам GPT‑Red.
Мы держим GPT‑Red отдельно от развертываемых нами моделей. Это позволяет оградить вредоносные возможности, которые мы целенаправленно закладываем в GPT‑Red, от попадания в руки злоумышленников, одновременно обеспечивая надежность наших производственных моделей.
Насколько сильна GPT‑Red?
GPT‑Red демонстрирует высокую эффективность против популяции моделей-защитников и сценариев red-teaming, на которых она обучалась. Мы также оцениваем, полезна ли модель в качестве универсального агента red-teaming для повышения безопасности в OpenAI в целом. Для этого мы проверяем эффективность GPT‑Red в новых средах безопасности и на целевых моделях.
Сначала мы оцениваем способность GPT‑Red обобщать знания на новые сценарии red-teaming, используя реплицированную версию арены непрямого внедрения промптов от Дземьяна и др. (2025). В этом испытании как специалисты-люди, так и GPT‑Red независимо друг от друга предложили атаки против GPT‑5.1 наборе заранее определенных сред. Эти сценарии и цели red-teaming отличаются от тех, которые использовались для обучения GPT‑Red. GPT‑Red достигает значительно более высоких показателей успешности атак, добиваясь успеха в 84% сценариев по сравнению с 13% у людей.
GPT‑Red превосходно справляется с ролью автоматизированного агента red-teaming. GPT‑Red способна генерировать успешные атаки против GPT‑5.1 в значительно большем числе сценариев, чем специалисты-люди, на арене непрямого внедрения промптов от Дземьяна и др. (2025) с использованием внутреннего зеркала.
Реалистичные кейсы red-teaming
Высшей проверкой для инструмента red-teaming является способность достигать целевых вредоносных целей против реальных агентских систем при неполном знании базовой модели системы и структуры фреймворка. Наш первый эксперимент в этой обстановке противопоставил GPT‑Red торговому автомату на базе ИИ в офисе OpenAI (аналогично Project Vend), созданному компанией Andon Labs. Мы предоставили GPT‑Red описание системы и возможность отправлять атаки и наблюдать за вызовами инструментов от симулированного агента, что очень близко имитирует развертывание в реальном мире. Проведя итерации атак, GPT‑Red развернула свою атаку против рабочего агента, достигнув всех трех своих вредоносных целей:
- изменение цены дорогого товара в наличии до минимально разрешенной в $0,50;
- заказ нового товара стоимостью от $100 и предложение его за $0,50;, а также
- отмена заказа другого клиента.
Мы раскрыли эти уязвимости, и в настоящее время активно тестируются новые средства защиты.
GPT‑Red способна взломать работающего автономного агента по имени Vendy, который управляет торговым автоматом. GPT‑Red смогла заставить производственного агента изменить цены дорогих товаров на дешевые и отменить заказы других клиентов, сначала проведя тестирование в симуляции, а затем перенеся атаки на работающего агента.
Мы также используем GPT‑Red для атаки на агента Codex CLI (на базе GPT‑5.4 mini) наборе из 10 отложенных сценариев эксфильтрации данных. Мы сравниваем модель с базовой линией на основе промптов GPT‑5.5, чтобы изучить влияние нашей процедуры обучения на производительность red-teaming на отложенных данных. GPT‑Red оказывается как более эффективной — в том смысле, что она может успешно заставлять агента эксфильтровать конфиденциальные данные в большем числе сценариев — так и более токеноэффективной.
GPT‑Red более эффективна и результативна при взломе работающих агентов codex. Мы проводим тестирование против агента codex на базе GPT‑5.4 Mini на пользовательском наборе из 10 задач по эксфильтрации данных.
Повышение надежности с помощью GPT‑Red
Конечная цель GPT‑Red — повышение надежности наших моделей. За последние шесть месяцев мы обучили последовательно более мощные модели red-teaming (предшественники GPT‑Red) с использованием возрастающих вычислительных мощностей и применяли эти модели при обучении каждой последующей производственной модели начиная с GPT‑5.3. Со временем каждый последующий релиз GPT становился все более надежным.
В качестве примера можно привести раннюю версию GPT‑Red, которая обнаружила новый класс атак прямого внедрения промптов, известных как атаки «Fake Chain-of-Thought» (фальшивая цепочка рассуждений). Эти атаки достигали показателей успешности более 95% на GPT‑5.1, но теперь этот показатель составляет менее 10% для GPT‑5.6 Sol. Аналогичным образом, несколько наших бенчмарков непрямого внедрения промптов, нацеленных на атаки в инструментах разработчика и веб-серфинге, были исчерпаны нашей новейшей моделью (>97% точности).
Устойчивость к самой GPT‑Red также существенно возросла. В широком спектре сред для проверки надежности показатели успешности атак GPT‑Red монотонно снижались с течением времени. В нашем новейшем релизе модели GPT‑5.6 Sol дает сбои лишь на 0,05% прямых внедрений промптов от GPT‑Red.
Продолжая масштабировать обучение с помощью самоигрывания для внедрения промптов, мы обнаружили новые угрозы, способные взламывать существующие модели. Тем не менее, наше масштабирование также помогло существенно повысить устойчивость к этим атакам. Коэффициент успешности атак рассчитывается как средняя успешность попыток по всем попыткам GPT‑Red в отложенных средах.
Надежность при сохранении высокой производительности
Модель может казаться более безопасной, если она отклоняет больше запросов или теряет в функциональности. Модель, которая делает меньше, естественно, сложнее атаковать, но это не та устойчивость, которая приносит пользу.
Мы тщательно оцениваем как общие передовые возможности, так и специально разработанные нами задачи на избыточные отказы. Мы обнаруживаем, что все базовые возможности остаются неизменными, в то время как устойчивость значительно возрастает. Это говорит о том, что прирост устойчивости обусловлен лучшим противодействием вредоносным инструкциям, а не некорректным использованием инструментов или отказом от выполнения легитимных запросов по умолчанию.
Следующие шаги
ИИ-агенты уже используются для расширения возможностей наших моделей нового поколения. Мы верим, что с помощью GPT-Red мы начали задействовать аналогичный маховик безопасности, когда модели сегодняшнего дня могут использоваться для того, чтобы сделать модели завтрашнего дня более устойчивыми, согласованными и заслуживающими доверия. Мы продолжим масштабировать вычислительные мощности и данные, одновременно совершенствуя алгоритмы, чтобы обучать будущие версии GPT-Red, которые будут сильнее сегодняшней модели. В свою очередь, эти модели помогут сделать будущие релизы GPT еще более безопасными.
Автор
Полный текст статьи читайте на OpenAI
