Обучаемые роботы
Мы создали робототехническую систему, обученную исключительно в симуляции и развернутую на физическом роботе, которая способна освоить новую задачу после однократного просмотра того, как она выполняется.

Иллюстрация: Бен Барри (Ben Barry)
Алгоритмы
В прошлом месяце мы продемонстрировали более раннюю версию этого робота, в которой система компьютерного зрения была обучена с использованием рандомизации доменов, то есть путем демонстрации смоделированных объектов с различными цветами, фонами и текстурами без использования реальных изображений.
Теперь мы разработали и внедрили новый алгоритм — однократное обучение подражанием, позволяющий человеку объяснить роботу новую задачу, выполнив ее в виртуальной реальности (VR). Получив всего одну демонстрацию, робот способен решить ту же задачу из произвольной начальной конфигурации.
Общий порядок действий

Наша система способна перенять поведение по единственной демонстрации, записанной в симуляторе, а затем воспроизвести его в различных условиях реального мира.
Система работает на базе двух нейросетей: сети визуального восприятия и сети подражания.
Сеть визуального восприятия принимает изображение с камеры робота и выдает состояние, отражающее положение объектов. Как и ранее, эта сеть обучена на сотнях тысяч смоделированных изображений с различными вариациями освещения, текстур и объектов. (Система зрения никогда не обучалась на реальных изображениях.)
Сеть подражания наблюдает за демонстрацией, обрабатывает ее, чтобы определить замысел задачи, а затем выполняет этот замысел, начиная с другой исходной конфигурации. Таким образом, сеть подражания должна обобщить демонстрацию для новых условий. Но откуда сеть подражания знает, как производить такое обобщение?
Сеть учится этому на основе распределения тренировочных примеров. Она обучается на дюжине различных задач, для каждой из которых предусмотрены тысячи демонстраций. Каждый тренировочный пример представляет собой пару демонстраций, выполняющих одну и ту же задачу. Сети передается вся первая демонстрация и лишь одно наблюдение из второй демонстрации. Затем мы используем обучение с учителем, чтобы предсказать, какое действие совершил демонстратор в момент этого наблюдения. Чтобы успешно предсказать действие, робот должен научиться выделять релевантную часть задачи из первой демонстрации.
В применении к задаче укладки блоков обучающие данные состоят из пар траекторий, которые собирают блоки в аналогичные башни в том же порядке, но стартуют из разных начальных состояний. Таким образом, сеть подражания учится воспроизводить порядок блоков и высоту башен, не заботясь об относительном расположении самих башен.
Укладка блоков
Задача создания цветовых комбинаций из блоков настолько проста, что мы смогли решить ее с помощью запрограммированного сценария (политики) в симуляторе. Мы использовали этот сценарий для генерации обучающих данных для сети подражания. На этапе тестирования сеть подражания смогла распознать демонстрации, записанные человеком, несмотря на то, что ранее ей не доводилось работать с «зашумленными» человеческими данными.
Сеть подражания использует механизм мягкого внимания (soft attention) к траектории демонстрации и вектору состояния, который представляет расположение блоков, что позволяет системе работать с демонстрациями переменной длины. Она также применяет механизм внимания к позициям различных блоков, что позволяет ей имитировать более длинные траектории, чем те, что она видела в процессе обучения, и складывать блоки в конфигурации, содержащие больше блоков, чем любая демонстрация из ее обучающей выборки.
Чтобы сеть подражания выработала надежную стратегию поведения, нам пришлось внести умеренное количество шума в выходные данные запрограммированного сценария. Это вынудило сценарий демонстрировать, как исправлять ситуацию, когда что-то идет не так, что научило сеть подражания справляться с отклонениями, вызванными несовершенством стратегии. Без внесения шума стратегия, усвоенная сетью подражания, как правило, не справлялась с задачей укладки.
Если вы хотите помочь нам в создании этого робота, присоединяйтесь к нам в OpenAI.
Авторы
Авторы
Полный текст статьи читайте на OpenAI
