Воспроизведение опыта с учётом заднего умысла (Hindsight Experience Replay)

Читать статью
Hindsight Experience Replay

Аннотация

Работа с разреженными наградами — одна из величайших проблем в обучении с подкреплением (RL). Мы представляем новый метод под названием «Воспроизведение опыта с учётом заднего умысла» (Hindsight Experience Replay), который позволяет эффективно использовать выборки для обучения на разреженных и бинарных наградах, тем самым избавляя от необходимости сложного проектирования наград. Метод может быть объединен с любым алгоритмом обучения с подкреплением вне политики (off-policy) и может рассматриваться как форма неявного учебного плана.

Мы демонстрируем наш подход на задаче манипулирования объектами с помощью роборуки. В частности, мы проводим эксперименты с тремя различными задачами: толкание, скольжение, а также захват и перемещение (pick-and-place), причем в каждом случае используются только бинарные награды, указывающие на то, выполнена задача или нет. Наши исследования методом выбывания (ablation studies) показывают, что воспроизведение опыта с учётом заднего умысла является важнейшим компонентом, который делает обучение возможным в столь сложных средах. Мы показываем, что наши стратегии, обученные на физическом симуляторе, могут быть развернуты на реальном роботе и успешно справляются с поставленной задачей.

Авторы

Марцин Андрыхович, Филип Вольский, Алекс Рэй, Йонас Шнайдер, Рэйчел Фонг, Питер Велиндер, Боб МакГрю, Джош Тобин, Питер Абил, Войцех Заремба

Полный текст статьи читайте на OpenAI