Обучение имитации за один пример (One-shot imitation learning)

Читать статью
One Shot Imitation Learning

Аннотация

Обучение имитации обычно применяется для решения различных задач по отдельности. Это, как правило, требует либо тщательной инженерии признаков, либо значительного количества выборок. Это далеко от того, к чему мы стремимся: в идеале роботы должны уметь учиться на очень небольшом числе демонстраций любой заданной задачи и мгновенно обобщать их на новые ситуации в рамках той же задачи, не требуя разработки под конкретную задачу. В этой статье мы предлагаем фреймворк метаобучения для достижения такой способности, который мы называем обучением имитации за один пример (one-shot imitation learning).

В частности, мы рассматриваем сценарий, когда существует очень большой набор задач, и каждая задача имеет множество реализаций. Например, одна задача может заключаться в том, чтобы сложить все блоки на столе в одну башню, другая задача — в том, чтобы разложить все блоки на столе в башни из двух блоков и т. д. В каждом случае различные экземпляры задачи будут состоять из разных наборов блоков с разными начальными состояниями. Во время обучения нашему алгоритму предоставляются пары демонстраций для подмножества всех задач. Обучается нейронная сеть, которая принимает в качестве входных данных одну демонстрацию и текущее состояние (которое изначально является начальным состоянием второй демонстрации из пары) и выдает действие с целью добиться того, чтобы полученная последовательность состояний и действий как можно точнее совпадала со второй демонстрацией. Во время тестирования предъявляется демонстрация единичного экземпляра новой задачи, и ожидается, что нейронная сеть покажет хорошие результаты на новых экземплярах этой новой задачи. Использование мягкого внимания (soft attention) позволяет модели обобщать условия и задачи, не встречавшиеся в обучающих данных. Мы предполагаем, что, обучая эту модель на гораздо более разнообразном наборе задач и условий, мы получим универсальную систему, способную превращать любые демонстрации в надежные стратегии, способные решать огромное разнообразие задач.

Видео доступны по адресу этой ссылке в arXiv .

Авторы

Yan Duan, Marcin Andrychowicz, Bradly Stadie, Jonathan Ho, Jonas Schneider, Ilya Sutskever, Pieter Abbeel, Wojciech Zaremba

Полный текст статьи читайте на OpenAI