Некоторые соображения по поводу обучения исследованию с помощью мета-обучения с подкреплением
Читать статью

Аннотация
Мы рассматриваем проблему исследования в мета-обучении с подкреплением. Предложены два новых алгоритма мета-обучения с подкреплением: E-MAML и E-RL². Представлены результаты на новой среде под названием «Krazy World» и наборе лабиринтных сред. Мы показываем, что E-MAML и E-RL² обеспечивают лучшую производительность в задачах, где исследование имеет важное значение.
Авторы
Брэдли Стади (Bradly Stadie), Гэ Янг (Ge Yang), Рейн Хаутхуфт (Rein Houthooft), Си Чен (Xi Chen), Ян Дуан (Yan Duan), Юхуай Ву (Yuhuai Wu), Питер Аббел (Pieter Abbeel), Илья Суцкевер (Ilya Sutskever)
Полный текст статьи читайте на OpenAI
