Обучение с подражанием от третьего лица

Читать научную работу
Third Person Imitation Learning

Аннотация

Обучение с подкреплением (RL) позволяет обучать агентов, способных решать сложные задачи в неопределенной и изменчивой среде. Ключевая сложность в обучении с подкреплением заключается в определении функции вознаграждения, которую агент должен оптимизировать. Традиционно для решения этой проблемы использовалось обучение с подражанием в RL. К сожалению, до сих пор методы обучения с подражанием обычно требуют предоставления демонстраций от первого лица: агенту передается последовательность состояний и спецификация действий, которые он должен был совершить. Несмотря на свою эффективность, этот вид обучения с подражанием ограничен относительно сложной задачей сбора демонстраций от первого лица. Люди решают эту проблему путем обучения на основе демонстраций от третьего лица: они наблюдают за тем, как другие люди выполняют задачи, делают выводы о сути задачи и выполняют ее самостоятельно.

В этой статье мы представляем метод неконтролируемого обучения с подражанием от третьего лица. В данном контексте термин «от третьего лица» означает обучение агента успешному достижению простой цели в простой среде, когда ему предоставляется демонстрация учителя, выполняющего ту же цель, но с другой точки зрения;, а «неконтролируемое» указывает на то, что агент получает только эти демонстрации от третьего лица и ему не предоставляется соответствие между состояниями учителя и состояниями ученика. Основное понимание, лежащее в основе нашего метода, заключается в том, что недавние достижения в области смешения доменов могут быть использованы для получения доменно-независимых признаков, которые имеют решающее значение в процессе обучения. Для подтверждения нашего подхода мы приводим успешные эксперименты по обучению на основе демонстраций от третьего лица в домене точечной массы (pointmass), домене манипулятора (reacher) и для задачи с перевернутым маятником.

Авторы

Брэдли Стади (Bradly Stadie), Питер Аббил (Pieter Abbeel), Илья Суцкевер (Ilya Sutskever)

Полный текст статьи читайте на OpenAI