Проверка устойчивости к непредвиденным противникам

Мы разработали метод для оценки того, способен ли классификатор на основе нейронной сети надежно защищаться от состязательных атак, с которыми он не сталкивался во время обучения. Наш метод позволяет получить новую метрику UAR (Устойчивость к непредвиденным атакам, Unforeseen Attack Robustness), которая оценивает надежность отдельной модели против непредвиденной атаки и подчеркивает необходимость измерения производительности в более широком диапазоне непредвиденных атак.
Современные нейронные сети достигли высокой точности в самых разных базовых задачах. Тем не менее, они остаются уязвимыми к состязательным примерам — небольшим, но тщательно смоделированным искажениям входных данных, созданным злоумышленниками для обмана сетей. Например, состязательный пример с L∞ L_\infty -искажением, приведенный ниже, отличается от исходного изображения не более чем на 32 единицы для каждого значения RGB-пикселя; человек все еще может правильно классифицировать измененное изображение, но стандартная нейронная сеть уверенно относит его к неверному классу.
Примеры изображений (черный лебедь), сгенерированные с помощью состязательных атак с различными типами искажений. Каждое искажение оптимизировано для обмана сети.
Системам искусственного интеллекта, развертываемым в реальных условиях, потребуется быть устойчивыми к непредвиденным атакам, однако большинство средств защиты до сих пор были сосредоточены на конкретных известных типах атак. В этой области был достигнут прогресс в укреплении моделей против таких атак; однако устойчивость к одному типу искажения частонепереноситсянаустойчивость к атакам, непредвиденным создателями модели. Следовательно, оценка только по одному типу искажения может создать ложное ощущение безопасности в отношении модели, работающей в реальных условиях, которая может оставаться уязвимой к непредвиденным атакам, таким как поддельные очки и состязательные стикеры.
Пример ситуации, когда состязательная устойчивость переносится плохо. Укрепление модели против искажения А изначально повышает устойчивость как к искажению А, так и к искажению В. Однако по мере дальнейшего укрепления состязательная устойчивость к искажению В ухудшается, в то время как для искажения А она остается примерно прежней; (А = _L_∞, Б = _L_1). Точность модели по отношению к искажению А достигает пика при уровне укрепления 8, поскольку этого достаточно для защиты от атаки, а дальнейшее укрепление ухудшает точность на чистых данных; подробности см. в полной версии статьи.
Принципы метода
Мы создали трехэтапный метод для оценки того, насколько хорошо модель справляется с новым, ранее не встречавшимся типом искажения. Наш метод проводит оценку на основе различных непредвиденных атак в широком диапазоне размеров искажений и сравнивает результаты со специализированной сильной защитой, которой известен тип искажения. Он также предоставляет новую метрику UAR, которая оценивает состязательную устойчивость моделей к непредвиденным типам искажений.
1. Оценка на основе разнообразных непредвиденных типов искажений
Типичные научные работы по состязательной защите проводят оценку только по широко изучаемым типам искажений L∞ L_\infty или L2 L_2 . Тем не менее, мы показываем, что оценка по этим искажениям дает практически одинаковую информацию о состязательной устойчивости.
2. Выбор широкого диапазона размеров искажений, откалиброванного по сильным моделям
Мы обнаружили, что рассмотрение слишком узкого диапазона размеров искажений может обратить вспять качественные выводы о состязательной устойчивости. Чтобы выбрать диапазон, мы изучаем изображения, созданные в результате атаки при различных размерах искажений, и выбираем наибольший диапазон, в котором изображения все еще распознаваемы человеком. Однако, как показано ниже, атака с большим бюджетом искажений использует его только против сильной защиты. Мы рекомендуем выбирать откалиброванный диапазон размеров искажений путем оценки на моделях, прошедших состязательное обучение (мы также предоставляем откалиброванные размеры для широкого спектра атак в нашем пакете кода).
Примеры изображений (кофемашина) при применении одной и той же сильной атаки к различным моделям защиты. Атака на более сильные средства защиты приводит к большим визуальным искажениям.

Без защиты

Слабая защита

Сильная защита
3. Бенчмаркинг состязательной устойчивости на моделях, прошедших состязательное обучение
Мы разработали новую метрику UAR, которая сравнивает устойчивость модели к атаке с состязательным обучением против этой атаки. Состязательное обучение — это надежная защита, использующая знание о противнике посредством обучения на изображениях, подвергшихся состязательной атаке.
Мы вычислили значения UAR для моделей, прошедших состязательное обучение, для нескольких различных типов искажений. Как показано ниже, устойчивость, обеспечиваемая состязательным обучением, не переносится широко на непредвиденные искажения. Фактически, устойчивость к известному искажению может снизить устойчивость к непредвиденным искажениям. Эти результаты подчеркивают необходимость оценки в отношении значительно более разнообразных атак, таких как Elastic, Fog, Gabor и Snow.
Дальнейшие шаги
Мы надеемся, что исследователи, разрабатывающие состязательно устойчивые модели, будут использовать нашу методологию для оценки по более разнообразному набору непредвиденных атак. Наш код включает в себя набор атак, модели, прошедшие состязательное обучение, и калибровки, которые позволяют легко вычислять UAR.
Если вам интересны темы безопасности ИИ, рассмотрите возможностьотправки резюме для работы в OpenAI.
Сноски
Полный текст статьи читайте на OpenAI
