Алгоритмы вариационного поиска опций

Аннотация
Мы исследуем методы поиска опций, основанные на вариационном выводе, и вносим два алгоритмических вклада. Во-первых, мы подчеркиваем тесную связь между методами вариационного поиска опций и вариационными автоэнкодерами, а также представляем VALOR (Variational Autoencoding Learning of Options by Reinforcement) — новый метод, выведенный из этой связи. В VALOR стратегия кодирует контексты из шумового распределения в траектории, а декодер восстанавливает контексты из полных траекторий. Во-вторых, мы предлагаем подход обучения по учебной программе (curriculum learning), при котором количество контекстов, видимых агентом, увеличивается всякий раз, когда производительность агента становится достаточно высокой (согласно измерениям декодера) на текущем наборе контекстов. Мы показываем, что этот простой трюк стабилизирует обучение для VALOR и предыдущих методов вариационного поиска опций, позволяя одному агенту изучать гораздо больше моделей поведения, чем это было бы возможно при фиксированном распределении контекстов. Наконец, мы исследуем другие темы, связанные с вариационным поиском опций, включая фундаментальные ограничения общего подхода и применимость изученных опций к последующим задачам.
Авторы
Полный текст статьи читайте на OpenAI
