Обобщение на основе симуляции

Наши новейшие методы робототехники позволяют контроллерам роботов, полностью обученным в симуляции и развернутым на физических роботах, реагировать на непредвиденные изменения в окружающей среде при решении простых задач. Иными словами, мы использовали эти методы для создания систем с замкнутым контуром (closed-loop), а не с разомкнутым, как раньше.
Симулятору не обязательно точно воспроизводить реальный мир по внешнему виду или динамике; вместо этого мы рандомизируем ключевые аспекты окружающей среды: от трения и задержек выполнения действий до шума датчиков. Наши новые результаты служат дополнительным доказательством того, что роботов общего назначения можно создавать путем обучения исключительно в симуляции с последующей небольшой самокалибровкой в реальном мире.
Рандомизация динамики
Мы разработали рандомизацию динамики для обучения робота адаптации к неизвестной динамике реального мира. В процессе обучения мы рандомизируем большой набор из девяноста пяти свойств, определяющих динамику среды. Среди них: изменение массы каждого сочленения в теле робота; трение и затухание объекта, с которым он работает; высота стола, на котором находится объект; задержка между действиями; шум в наблюдениях и так далее.
Мы использовали этот подход для обучения стратегии на базе LSTM-сети для перемещения хоккейной шайбы по столу. Наши прямосвязные нейросети не справляются с этой задачей, тогда как LSTM могут использовать прошлые наблюдения для анализа динамики мира и соответствующей корректировки своего поведения.
От зрения к действию
Мы также обучили робота методом сквозного обучения (end-to-end) в симуляции с использованием обучения с подкреплением (RL) и перенесли полученную стратегию на физического робота. Созданная система напрямую преобразует визуальные данные в действия без использования специальных датчиков и способна адаптироваться к визуальной обратной связи.
Обилие результатов применения RL с симулированными роботами может создать впечатление, что обучение с подкреплением легко справляется с большинством робототехнических задач. Однако стандартные алгоритмы RL хорошо работают только в тех задачах, где малые изменения в действиях приводят к постепенному изменению награды. Некоторые робототехнические задачи имеют простые награды (например, ходьба, где оценивается пройденное расстояние). Но большинство задач не таковы — чтобы задать плотную награду для укладывания блоков друг на друга, вам потребуется закодировать множество условий: что рука находится близко к блоку, что она приближается к нему под правильным углом, что блок оторван от земли, расстояние от блока до целевой позиции и т. д.
Мы потратили несколько месяцев на безуспешные попытки заставить классические алгоритмы RL работать с задачами захвата и перемещения объектов (pick-and-place), прежде чем в итоге разработали новый алгоритм обучения с подкреплением — Hindsight Experience Replay (HER). Он позволяет агентам учиться на основе бинарной награды, делая вид, что неудача и была их изначальной целью, и соответствующим образом извлекая из неё уроки. (По аналогии: представьте, что вы искали заправку, но оказались у пиццерии. Вы по-прежнему не знаете, где купить бензин, но теперь знаете, где взять пиццу.) Мы также применили рандомизацию домена к визуальным формам, чтобы создать систему зрения, достаточно устойчивую для работы в реальном мире.
Наша реализация HER использует технику «актор-критик» (actor-critic) с асимметричной информацией. (Актор — это стратегия, а критик — это сеть, которая получает пары «действие/состояние» и оценивает их Q-значение, или сумму будущих наград, предоставляя сигнал для обучения актора.) В то время как критик имеет доступ к полному состоянию симулятора, актор работает только с данными RGB и глубины. Таким образом, критик может предоставлять абсолютно точную обратную связь, в то время как актор использует только те данные, которые доступны в реальном мире.
Затраты
Оба метода увеличивают требования к вычислительным ресурсам: рандомизация динамики замедляет обучение примерно в 3 раза, в то время как обучение по изображениям, а не по состояниям, протекает примерно в 5–10 раз медленнее.
Мы видим три подхода к созданию роботов общего назначения: обучение на огромных парках физических роботов, максимальное приближение симуляторов к реальному миру и рандомизация симулятора для обеспечения возможности обобщения модели на реальный мир. Мы всё больше убеждаемся, что третий путь станет важнейшей частью решения.
Если вы хотите помочь нам в создании роботов общего назначения, рассмотрите возможность присоединиться к нашей команде в OpenAI.
Авторы
Полный текст статьи читайте на OpenAI
