Эквивалентность между градиентами политик и мягким Q-обучением

Читать статью
Equivalence Between Policy Gradients And Soft Q Learning

Аннотация

Два ведущих подхода к обучению с подкреплением без модели — это методы градиента политики и методы Q-обучения. Методы Q-обучения могут быть эффективными и требовательными к выборке, когда они работают, однако до конца не изучено, почему именно они работают, поскольку эмпирически оцениваемые ими Q-значения очень неточны. Частичным объяснением может служить то, что методы Q-обучения скрыто реализуют обновления градиента политики: мы показываем, что существует точная эквивалентность между Q-обучением и методами градиента политики в условиях энтропийно-регуляризованного обучения с подкреплением, и что «мягкое» (энтропийно-регуляризованное) Q-обучение полностью эквивалентно методу градиента политики. Мы также указываем на связь между методами Q-обучения и методами естественного градиента политики. Экспериментально мы исследуем энтропийно-регуляризованные версии Q-обучения и градиентов политик и обнаруживаем, что они работают так же хорошо (или немного лучше), как и стандартные варианты на бенчмарке Atari. Мы также показываем, что эта эквивалентность сохраняется в практических сценариях, создавая метод Q-обучения, который точно повторяет динамику обучения A3C без использования целевой сети или расписания исследования $\epsilon$-greedy.

Авторы

Джон Шульман (John Schulman), Си Чен (Xi Chen), Питер Абиль (Pieter Abbeel)

Полный текст статьи читайте на OpenAI