Переход от симуляции к реальному миру с помощью обучения глубокой модели обратной динамики

Читать статью
Transfer From Simulation To Real World Through Learning Deep Inverse Dynamics Model

Аннотация

Разработка политик управления в симуляции часто оказывается более практичной и безопасной, чем проведение экспериментов непосредственно в реальном мире. Это справедливо для политик, полученных с помощью планирования и оптимизации, и тем более для политик, полученных посредством обучения с подкреплением, которое зачастую требует огромного количества данных. Тем не менее, политика, успешная в симуляции, часто не работает при развертывании на реальном роботе. Тем не менее, общий смысл действий политики в симуляции обычно остается верным и в реальном мире. В этой работе мы исследуем такие сценарии, где последовательность состояний, проходимых в симуляции, остается разумной для реального мира, даже если детали управления отличаются — как это может быть, когда ключевые различия кроются в деталях трения, контактов, массы и геометрии. Во время выполнения на каждом временном шаге наш подход вычисляет, что сделала бы управляющая политика на основе симуляции, но затем, вместо применения этих управляющих воздействий на реальном роботе, наш подход вычисляет, какие будущие состояния симуляция ожидает в результате, и полагается на обученную глубокую модель обратной динамики, чтобы определить, какое действие в реальном мире лучше всего подходит для достижения этих будущих состояний. Глубокие модели хороши лишь настолько, насколько хороши данные для их обучения, поэтому мы также предлагаем подход к сбору данных для (инкрементального) обучения глубокой модели обратной динамики. Наши эксперименты показывают, что наш подход выгодно отличается от различных базовых методов, разработанных для преодоления расхождений между симуляцией и реальным миром, включая управление по ошибке выхода и адаптацию гауссовской динамики.

Авторы

Paul Christiano, Zain Shah, Igor Mordatch, Jonas Schneider, Trevor Blackwell, Josh Tobin, Pieter Abbeel, Wojciech Zaremba

Полный текст статьи читайте на OpenAI