Состязательные атаки на политики нейронных сетей

Читать статью
Adversarial Attacks On Neural Network Policies

Аннотация

Известно, что классификаторы машинного обучения уязвимы к входным данным, злонамеренно созданным противниками с целью вызвать ошибочную классификацию. Подобные состязательные примеры (adversarial examples) активно изучались в контексте задач компьютерного зрения. В данной работе мы показываем, что состязательные атаки также эффективны при нацеливании на политики нейронных сетей в обучении с подкреплением. В частности, мы демонстрируем, что существующие методы создания состязательных примеров могут применяться для значительного ухудшения производительности обученных политик на этапе тестирования. Наша модель угроз рассматривает противников, способных вносить небольшие возмущения в необработанные входные данные политики. Мы описываем степень уязвимости для различных задач и алгоритмов обучения для подкласса атак на основе состязательных примеров как в условиях белого, так и черного ящика. Независимо от решаемой задачи или алгоритма обучения, мы наблюдаем значительное падение производительности даже при небольших состязательных возмущениях, которые неразличимы для человеческого восприятия. Видео доступны по адресу this http URL.

Авторы

Сэнди Хуан (Sandy Huang), Николя Паперно (Nicolas Papernot), Иэн Гудфеллоу (Ian Goodfellow), Янь Дуань (Yan Duan), Питер Аббил (Pieter Abbeel)

Полный текст статьи читайте на OpenAI