Улучшение исследования с помощью шума в параметрах

Иллюстрация: Бен Барри (Ben Barry)
Мы выяснили, что добавление адаптивного шума в параметры алгоритмов обучения с подкреплением часто повышает производительность. Этот метод исследования прост в реализации и крайне редко ухудшает показатели, поэтому его стоит попробовать для решения любой задачи.
Шум в параметрах позволяет обучать агентов значительно быстрее по сравнению с другими подходами. После обучения на протяжении 20 эпизодов в среде OpenAI Gym HalfCheetah (показана выше) стратегия достигает результата около 3000 баллов, в то время как стратегия, обученная с использованием традиционного шума в пространстве действий, набирает лишь около 1500 баллов.
Шум в параметрах добавляет адаптивный шум в параметры стратегии нейронной сети, а не в пространство ее действий. Традиционное обучение с подкреплением использует шум в пространстве действий для изменения вероятностей, связанных с каждым возможным действием агента от момента к моменту. Шум в пространстве параметров внедряет случайность непосредственно в параметры агента, изменяя типы принимаемых им решений так, чтобы они всегда полностью зависели от текущих ощущений агента. Эта техника представляет собой нечто среднее между эволюционными стратегиями (где вы манипулируете параметрами стратегии, но не влияете на действия, которые она совершает при исследовании среды во время каждого прогона) и подходами глубокого обучения с подкреплением, такими как TRPO, DQN и DDPG (где параметры не затрагиваются, но шум добавляется в пространство действий стратегии).

Шум в параметрах помогает алгоритмам эффективнее исследовать свои среды, что приводит к более высоким результатам и более элегантному поведению. Мы полагаем, что это происходит потому, что целенаправленное добавление шума в параметры стратегии делает исследование агента согласованным на разных временных шагах, в то время как добавление шума в пространство действий приводит к более непредсказуемому исследованию, не коррелирующему ни с чем уникальным для параметров агента.
Люди раньше пытались применять шум в параметрах к градиентам стратегии. Мы развили этот подход, показав, что метод работает для стратегий на основе глубоких нейронных сетей и может применяться как к алгоритмам On-Policy, так и к Off-Policy.
Проводя данное исследование, мы столкнулись с тремя проблемами:
- Различные слои сети имеют разную чувствительность к возмущениям.
- Чувствительность весов стратегии может меняться со временем по мере обучения, что затрудняет предсказание действий, которые предпримет стратегия.
- Выбор правильного масштаба шума сложен, поскольку интуитивно трудно понять, как именно параметр шума влияет на стратегию в процессе обучения.
Для решения первой проблемы мы используем нормализацию слоев (layer normalization), которая гарантирует, что выходные данные возмущенного слоя (которые станут входом для следующего) по-прежнему находятся в рамках схожего распределения.
Вторую и третью проблемы мы решаем путем внедрения адаптивной схемы настройки размера возмущений в пространстве параметров. Эта настройка работает за счет измерения эффекта возмущения на пространство действий и проверки того, оказывается ли уровень шума в пространстве действий больше или меньше заданного целевого значения. Этот трюк позволяет перенести задачу выбора масштаба шума в пространство действий, которое является более интерпретируемым, чем пространство параметров.
Базовые показатели и бенчмарки
Мы также выпускаем базовый код, в котором эта техника интегрирована для DQN, Double DQN, Dueling DQN, Dueling Double DQN и DDPG.

Мы включили бенчмарки производительности DDQN с шумом в параметрах и без него для подмножества корпуса игр Atari, а также трех вариантов DDPG для ряда задач непрерывного управления в симуляторе Mujoco.
Разработка
Когда мы только проводили это исследование, мы обнаружили, что возмущения, применяемые к Q-функции DQN, порой могли быть настолько экстремальными, что приводили к многократному повторению алгоритмом одного и того же действия. Чтобы справиться с этим, мы добавили отдельную «голову» (head), явно представляющую стратегию, как в DDPG (в обычном DQN стратегия представлена лишь неявно через Q-функцию), чтобы сделать настройку более похожей на другие наши эксперименты. Однако при подготовке кода к этому релизу мы провели эксперимент с использованием шума в пространстве параметров без отдельной головы стратегии. Мы обнаружили, что это работает сопоставимо с версией, имеющей отдельную голову стратегии, и при этом гораздо проще в реализации. Дальнейшие эксперименты подтвердили, что отдельная голова стратегии действительно не нужна, поскольку алгоритм, вероятно, улучшился со времени наших ранних экспериментов благодаря изменению подхода к масштабированию шума. Это привело к созданию более простого, легкого в реализации и менее затратного в обучении алгоритма при достижении практически тех же результатов. Важно помнить, что алгоритмы искусственного интеллекта, особенно в обучении с подкреплением, могут давать сбои тихо и незаметно, что может заставлять инженеров создавать обходные решения для неисправленных багов.
Авторы
Полный текст статьи читайте на OpenAI
