Обучение имитации за один пример (One-shot imitation learning)

Аннотация
Обучение имитации обычно применяется для решения различных задач по отдельности. Это, как правило, требует либо тщательной инженерии признаков, либо значительного количества выборок. Это далеко от того, к чему мы стремимся: в идеале роботы должны уметь учиться на очень небольшом числе демонстраций любой заданной задачи и мгновенно обобщать их на новые ситуации в рамках той же задачи, не требуя разработки под конкретную задачу. В этой статье мы предлагаем фреймворк метаобучения для достижения такой способности, который мы называем обучением имитации за один пример (one-shot imitation learning).
В частности, мы рассматриваем сценарий, когда существует очень большой набор задач, и каждая задача имеет множество реализаций. Например, одна задача может заключаться в том, чтобы сложить все блоки на столе в одну башню, другая задача — в том, чтобы разложить все блоки на столе в башни из двух блоков и т. д. В каждом случае различные экземпляры задачи будут состоять из разных наборов блоков с разными начальными состояниями. Во время обучения нашему алгоритму предоставляются пары демонстраций для подмножества всех задач. Обучается нейронная сеть, которая принимает в качестве входных данных одну демонстрацию и текущее состояние (которое изначально является начальным состоянием второй демонстрации из пары) и выдает действие с целью добиться того, чтобы полученная последовательность состояний и действий как можно точнее совпадала со второй демонстрацией. Во время тестирования предъявляется демонстрация единичного экземпляра новой задачи, и ожидается, что нейронная сеть покажет хорошие результаты на новых экземплярах этой новой задачи. Использование мягкого внимания (soft attention) позволяет модели обобщать условия и задачи, не встречавшиеся в обучающих данных. Мы предполагаем, что, обучая эту модель на гораздо более разнообразном наборе задач и условий, мы получим универсальную систему, способную превращать любые демонстрации в надежные стратегии, способные решать огромное разнообразие задач.
Видео доступны по адресу этой ссылке в arXiv .
Авторы
Полный текст статьи читайте на OpenAI
