Метаобучение для борьбы

Мы показываем, что в задаче симулированной робототехнической борьбы агент метаобучения может научиться быстро побеждать более сильного агента без метаобучения, а также демонстрируем, что агент метаобучения способен адаптироваться к физическим неполадкам.
Мы расширили алгоритм Model-Agnostic Meta-Learning (MAML), положив в основу его целевой функции оптимизацию по парам сред, а не по отдельным средам, как в стандартном MAML. MAML инициализирует стратегии наших агентов так, чтобы всего после нескольких обновлений параметров во время выполнения в новой среде (или задаче) агенты учились действовать в ней эффективнее. Обновления параметров стратегии при выполнении выполняются с помощью шагов градиентного подъема по награде, полученной за первые несколько эпизодов взаимодействия с новой средой. Обучаясь на парах, мы можем создавать стратегии, которые быстро адаптируются к ранее не встречавшимся средам, если только среда не слишком сильно отличается от предыдущих.
Чтобы протестировать наш подход к непрерывной адаптации, мы разработали 3 типа агентов — Муравей (4 ноги), Жук (6 ног) и Паук (8 ног) — и настроили многораундовую игру, в которой каждый агент проводил несколько матчей против одного и того же противника, адаптируя параметры своей стратегии между раундами для более эффективного противодействия стратегии соперника. В ходе тестов мы выяснили, что агенты, способные адаптировать свою тактику, гораздо сильнее соперников с фиксированными стратегиями. Обучив более сотни агентов, часть из которых освоила фиксированные стратегии, а другие научились адаптации, мы оценили приспособленность каждого агента.
Обучение на ходу также позволяет агентам справляться с необычными изменениями в собственном теле, например, приспосабливаться к тому, что некоторые из их конечностей со временем теряют функциональность. Это говорит о том, что мы можем использовать подобные методы для разработки агентов, способных справляться как с изменениями во внешней среде, так и с изменениями в собственных телах или внутренних состояниях.
Мы исследуем метаобучение в рамках нашей работы над крупномасштабными исследованиями мультиагентных систем. Кроме того, мы выпускаем среды MuJoCo и обученные стратегии, которые использовались в этой работе, чтобы другие исследователи могли экспериментировать с этими системами.
Авторы
Полный текст статьи читайте на OpenAI
