Состязательные атаки на политики нейронных сетей

Аннотация
Известно, что классификаторы машинного обучения уязвимы к входным данным, злонамеренно созданным противниками с целью вызвать ошибочную классификацию. Подобные состязательные примеры (adversarial examples) активно изучались в контексте задач компьютерного зрения. В данной работе мы показываем, что состязательные атаки также эффективны при нацеливании на политики нейронных сетей в обучении с подкреплением. В частности, мы демонстрируем, что существующие методы создания состязательных примеров могут применяться для значительного ухудшения производительности обученных политик на этапе тестирования. Наша модель угроз рассматривает противников, способных вносить небольшие возмущения в необработанные входные данные политики. Мы описываем степень уязвимости для различных задач и алгоритмов обучения для подкласса атак на основе состязательных примеров как в условиях белого, так и черного ящика. Независимо от решаемой задачи или алгоритма обучения, мы наблюдаем значительное падение производительности даже при небольших состязательных возмущениях, которые неразличимы для человеческого восприятия. Видео доступны по адресу this http URL.
Авторы
Полный текст статьи читайте на OpenAI
