Снижение дисперсии для градиента стратегии с факторизованными базовыми линиями, зависящими от действий

Читать статью
Variance Reduction For Policy Gradient With Action Dependent Factorized Baselines

Аннотация

Методы градиента стратегии добились больших успехов в глубоком обучении с подкреплением, однако они страдают от высокой дисперсии оценок градиента. Проблема высокой дисперсии особенно усугубляется в задачах с длинным горизонтом планирования или пространствами действий высокой размерности. Чтобы смягчить эту проблему, мы выводим несмещенную базовую линию, зависящую от действия, для снижения дисперсии, которая полностью использует структурную форму самой стохастической стратегии и не делает никаких дополнительных предположений о марковском процессе принятия решений (MDP). Мы демонстрируем и количественно оцениваем преимущества базовой линии, зависящей от действия, как с помощью теоретического анализа, так и на основе численных результатов, включая анализ субоптимальности оптимальной базовой линии, зависящей от состояния. Результатом является вычислительно эффективный алгоритм градиента стратегии, масштабируемый до задач управления высокой размерности, что продемонстрировано на синтетической задаче сопоставления с целевым значением размерности 2000. Наши экспериментальные результаты показывают, что базовые линии, зависящие от действий, обеспечивают более быстрое обучение на стандартных бенчмарках обучения с подкреплением, а также в задачах манипулирования рукой высокой размерности и в синтетических задачах. Наконец, мы показываем, что общая идея включения дополнительной информации в базовые линии для лучшего снижения дисперсии может быть распространена на задачи с частичной наблюдаемостью и многоагентные задачи.

Авторы

Cathy Wu, Aravind Rajeswaran, Yan Duan, Vikash Kumar, Alexandre M Bayen, Sham Kakade, Igor Mordatch, Pieter Abbeel

Полный текст статьи читайте на OpenAI