RL²: Быстрое обучение с подкреплением посредством медленного обучения с подкреплением

Читать статью
Rl Fast Reinforcement Learning Via Slow Reinforcement Learning

Аннотация

Глубокое обучение с подкреплением (deep RL) успешно применяется для автоматического освоения сложного поведения, однако этот процесс обучения требует огромного количества проб. В отличие от этого, животные способны осваивать новые задачи всего за несколько попыток, опираясь на свои предварительные знания об окружающем мире. Данная работа призвана преодолеть этот разрыв. Вместо проектирования «быстрого» алгоритма обучения с подкреплением мы предлагаем представить его в виде рекуррентной нейронной сети (RNN) и обучать на данных. В предложенном нами методе RL² алгоритм закодирован в весах RNN, которые медленно настраиваются с помощью универсального («медленного») алгоритма RL. RNN получает всю информацию, которую получал бы типичный алгоритм RL, включая наблюдения, действия, вознаграждения и флаги завершения; кроме того, она сохраняет свое состояние между эпизодами в заданном Марковском процессе принятия решений (MDP). Активации RNN сохраняют состояние «быстрого» алгоритма RL на текущем (ранее не встречавшемся) MDP. Мы экспериментально оцениваем RL² как на задачах малого, так и большого масштаба. На примере малого масштаба мы обучаем систему решать случайно сгенерированные задачи о многоруких бандитах и конечные MDP. После обучения RL² его производительность на новых MDP приближается к алгоритмам, разработанным человеком и обладающим гарантиями оптимальности. На крупномасштабном уровне мы тестируем RL² на задаче навигации на основе визуальных данных и показываем, что метод применим к проблемам высокой размерности.

Авторы

Янь Дуань (Yan Duan), Джон Шульман (John Schulman), Си Чэнь (Xi Chen), Питер Л. Бартлетт (Peter L. Bartlett), Илья Суцкевер (Ilya Sutskever), Питер Абил (Pieter Abbeel)

Полный текст статьи читайте на OpenAI