Использование вычислительных ресурсов на этапе инференса для обеспечения состязательной устойчивости

Catcus_Heatmap_2.png?w=1600&h=900&fit=fi

Первые свидетельства того, что модели рассуждения, такие как o1, становятся более устойчивыми к состязательным атакам по мере увеличения времени «размышлений».

Читать научную работу

Устойчивость к состязательным атакам уже более десяти лет остается одной из главных проблем в области искусственного интеллекта. В 2014 году исследователи продемонстрировали, что едва заметные возмущения — тонкие изменения, неразличимые для человеческого глаза — могут заставить модели неверно классифицировать изображения, что наглядно иллюстрирует уязвимость моделей к состязательным атакам. Устранение этого слабого места становится все более актуальным по мере того, как модели начинают применяться в критически важных сценариях и выступать в роли агентов, способных просматривать веб-страницы и совершать действия от имени пользователей.

Несмотря на годы интенсивных исследований, проблема защиты от состязательных атак далека от решения. Николас Карлини (Nicholas Carlini), эксперт в этой области, недавно заявил, что «в состязательном машинном обучении мы написали более 9 000 статей за десять лет и не добились прогресса». Одна из причин заключается в том, что, в отличие от других направлений развития ИИ, простое увеличение размера моделей оказалось недостаточным для обеспечения их устойчивости к состязательным атакам. 

В новой научной работе мы представляем предварительные свидетельства того, что увеличение вычислительных затрат на этапе инференса — предоставление моделям рассуждения большего времени и ресурсов для «размышлений» — может повысить устойчивость к различным типам атак. Этот подход используется в моделях рассуждения, таких как o1‑preview и o1‑mini, которые могут адаптировать свои вычисления во время инференса. Мы также исследуем новые атаки, разработанные специально для таких моделей рассуждения, а также сценарии, в которых увеличение вычислительных ресурсов на этапе инференса не повышает устойчивость, и рассуждаем о причинах этого и возможных путях решения проблемы.

Оценка взаимосвязи между состязательной устойчивостью и вычислениями на этапе инференса

Мы провели масштабные эксперименты, чтобы оценить, как увеличение вычислительных ресурсов на этапе инференса в моделях рассуждения (в частности, o1‑preview и o1‑mini от OpenAI) влияет на их устойчивость к состязательным атакам. Мы изучили широкий спектр задач, используя как статические, так и адаптивные методы атак, измеряя вероятность успешности атаки в зависимости от объема вычислений, задействованных моделью при инференсе. Мы обнаружили, что во многих случаях эта вероятность снижается — зачастую практически до нуля — по мере роста вычислительных затрат на инференс, хотя остаются и значительные исключения (описанные ниже).

Чтобы изучить взаимосвязь между состязательной устойчивостью (измеряемой ресурсами злоумышленника) и вычислениями во время тестирования, мы рассмотрели несколько различных типов задач. К ним относятся:

  1. Математические задачи, включая как очень простые (например, сложение или умножение двух чисел), так и более сложные, такие как MATH. Для каждой такой задачи мы рассмотрели ряд «целей» злоумышленника: заставить модель выдать число 42 вместо правильного ответа, заставить модель выдать правильный ответ плюс единицу или правильный ответ, умноженный на семь.
  2. Состязательная версия бенчмарка фактологичности SimpleQA. Это набор данных, состоящий из вопросов, которые намеренно подобраны так, чтобы модели было сложно ответить на них без поиска в интернете; мы смоделировали внедрение состязательных промптов в просматриваемые веб-страницы.
  3. Состязательные изображения из научной работы Attack Bard.
  4. Промпты с примерами нецелевого использования из бенчмарков StrongREJECT. Это промпты, которым модель не должна следовать, в то время как цель злоумышленника — заставить ее поступить иначе.
  5. Внутренняя оценка на предмет соблюдения одного из правил в спецификации нашей модели.

Мы рассмотрели несколько «поверхностей атак» для злоумышленника, включая:  

  1. Атаку методом «множества выстрелов» (many-shot attack, см. Anthropic 2024), при которой злоумышленник предоставляет ряд «некорректных» примеров ввода/вывода.
  2. Оптимизацию мягких токенов (произвольных векторов вложений) для достижения целей злоумышленника.
  3. Состязательную программу на базе языковой модели (LMP) — то есть структурированную программу, включающую языковые модели в свой поток управления — которая осуществляет «red teaming» с помощью ИИ.
  4. Состязательные мультимодальные входные данные.

Обратите внимание, что не все атаки применялись ко всем наборам данных; подробности см. в научной работе.

Во многих из этих случаев мы видим, что вероятность успеха злоумышленника снижается по мере увеличения объема вычислений на этапе инференса. Мы подчеркиваем, что, в отличие от традиционного подхода «состязательного обучения», модель не знает о природе атаки, и поэтому повышенная устойчивость достигается исключительно за счет увеличения вычислительных ресурсов на этапе инференса. Это говорит о том, что масштабирование вычислений во время инференса может быть полезным для борьбы даже с непредвиденными атаками.

Ограничения

Существуют случаи, когда вычисления на этапе инференса (по крайней мере, пока) не повышают устойчивость:

  1. В некоторых сценариях мы наблюдаем, что сначала успешность атак со стороны злоумышленника возрастает с увеличением вычислительных ресурсов защищающейся стороны на инференс, а затем снижается. Мы полагаем, что это происходит потому, что защитнику требуется минимальный объем вычислений во время тестирования для достижения цели злоумышленника (например, чтобы ответить правильным ответом плюс единица, модель сначала должна быть способна решить саму математическую задачу).
  2. Что еще более важно, существуют ситуации, когда успешность атаки не падает по мере выделения защитнику дополнительных вычислительных ресурсов на этапе инференса. Это особенно заметно на бенчмарке StrongREJECT при использовании атаки с помощью LMP. Некоторые промпты в этом бенчмарке запрашивают информацию, которая не запрещена при любых обстоятельствах, поэтому LMP может находить контексты, в которых ответом, соответствующим спецификации, является предоставление этой информации. Пример см. на Рисунке 10 в научной работе.
  3. Наша способность контролировать использование моделью вычислительных ресурсов во время тестирования несовершенна. Мы видим, что злоумышленник иногда может обмануть модель, заставив ее отказаться от размышлений или использовать вычислительные ресурсы на этапе инференса неэффективно. В рамках данной работы мы не исследовали задачу обучения модели «разумному» расходу выделенных вычислений и поступили самым наивным образом; мы считаем это перспективным направлением исследований для повышения состязательной устойчивости.

Дополнительные обсуждения ограничений и нерешенных вопросов см. в тексте работы.

Заключение

В целом мы рассматриваем данную работу как многообещающий знак того, что использование вычислительных ресурсов на этапе инференса способно обеспечить состязательную устойчивость. Как мы обсуждаем в статье, предстоит проделать еще много работы, чтобы воплотить этот потенциал в реальность, и мы рады внести свой вклад!

Авторы

OpenAI

Полный текст статьи читайте на OpenAI