Масштабное исследование обучения на основе любопытства

Аннотация
Алгоритмы обучения с подкреплением опираются на тщательную разработку наград среды, которые являются внешними по отношению к агенту. Однако аннотирование каждой среды вручную созданными плотными наградами не масштабируется, что обусловливает необходимость разработки функций вознаграждения, которые являются внутренними для агента. Любопытство — это тип функции внутреннего вознаграждения, которая использует ошибку предсказания в качестве сигнала вознаграждения. В этой статье: (a) Мы проводим первое крупномасштабное исследование обучения, основанного исключительно на любопытстве, т.е. без каких-либо внешних наград, на 54 стандартных тестовых средах, включая набор игр Atari. Наши результаты показывают удивительно высокую производительность и высокую степень соответствия между целью внутреннего любопытства и разработанными вручную внешними наградами во многих игровых средах. (b) Мы исследуем влияние использования различных пространств признаков для вычисления ошибки предсказания и показываем, что случайных признаков достаточно для многих популярных бенчмарков игр с обучением с подкреплением, но выученные признаки, по-видимому, обобщаются лучше (например, на новые уровни игр в Super Mario Bros.). © Мы демонстрируем ограничения наград на основе предсказаний в стохастических настройках. Видео игрового процесса и код доступны по адресу этой ссылке в https.
Авторы
Полный текст статьи читайте на OpenAI
