Асимметричный метод «актор-критик» для обучения роботов на основе изображений

Аннотация
Глубокое обучение с подкреплением (RL) зарекомендовало себя как мощный метод во многих областях принятия последовательных решений. Тем не менее, робототехника ставит перед RL множество задач; в частности, обучение на физической системе может быть дорогим и опасным, что вызвало значительный интерес к обучению политик управления с использованием физического симулятора. Хотя в ряде недавних работ были продемонстрированы многообещающие результаты переноса обученных в симуляции политик в реальный мир, они часто не в полной мере используют преимущества работы с симулятором. В данной работе мы используем полную наблюдаемость состояния в симуляторе для обучения более качественных политик, которые принимают на вход лишь частичные наблюдения (RGBD-изображения). Для этого мы применяем алгоритм обучения «актор-критик», в котором критик обучается на полных состояниях, в то время как актор (или политика) получает на вход рендеренные изображения. Мы экспериментально показываем на ряде смоделированных задач, что использование таких асимметричных входных данных значительно повышает производительность. Наконец, мы объединяем этот метод с рандомизацией домена и демонстрируем эксперименты с реальным роботом для таких задач, как захват, толкание и перемещение блока. Мы достигаем такого переноса из симуляции в реальный мир без обучения на каких-либо данных из реального мира.
Авторы
Полный текст статьи читайте на OpenAI
