Ретро-соревнование

Мы запускаем соревнование по трансферному обучению, которое измеряет способность алгоритма обучения с подкреплением к обобщению на основе прошлого опыта.

СоревнованиеЧитать статьюGym Retro
Retro Contest

Иллюстрация: Тимоти Дж. Рейнольдс (Timothy J. Reynolds)

Почему это важно

В типичных исследованиях по обучению с подкреплением (RL) алгоритмы тестируются в той же среде, в которой они проходили обучение, что дает преимущество алгоритмам, сильным в запоминании и имеющим множество гиперпараметров. Наше соревнование проверяет алгоритм на ранее не встречавшихся уровнях видеоигр. В нем используется Gym Retro — новая платформа, интегрирующая классические игры в Gym, начиная с 30 игр для SEGA Genesis.

Обновление: Результатыопубликованы!

В ретро-соревновании OpenAI вам предоставляется обучающий набор уровней из серии игр Sonic The Hedgehog™, а мы оцениваем ваш алгоритм на тестовом наборе пользовательских уровней, созданных нами специально для этого состязания. Соревнование пройдет с 5 апреля по 5 июня. Чтобы участникам было проще начать, мы выпускаем retro-baselines, библиотеку, которая показывает, как запускать различные алгоритмы обучения с подкреплением на задачах соревнования.

Plot All Human 3 28b

Базовые результаты в ретро-соревновании (на тестовом наборе) показывают, что алгоритмы RL значительно уступают результатам людей, даже при использовании трансферного обучения. Результаты людей показаны пунктирной горизонтальной линией. Люди играли всего один час против восемнадцати часов у алгоритмов.

Вы можете использовать любые среды или наборы данных во время обучения, но на этапе тестирования вам выделяется всего около 18 часов (1 миллион шагов по времени) на каждый совершенно новый уровень. 18 часов могут показаться долгим сроком для прохождения одного уровня игры, но существующие алгоритмы RL показывают себя гораздо хуже людей при таком бюджете на обучение.

Бенчмарк Sonic

Чтобы подробно описать бенчмарк и предоставить базовые результаты, мы выпускаем технический отчет:  Gotta Learn Fast: A New Benchmark for Generalization in RL. Этот отчет содержит подробную информацию о бенчмарке, а также результаты запуска Rainbow DQN,  PPO и простого алгоритма случайного перебора под названием JERK. JERK генерирует случайные последовательности действий способом, оптимизированным для Sonic, а по мере продвижения обучения чаще воспроизводит последовательность действий, набравшую наибольшее количество очков.

Мы обнаружили, что можем существенно повысить производительность PPO на тестовых уровнях, задействовав опыт, полученный на обучающих уровнях. Когда сеть проходила предварительное обучение на тренировочных уровнях и дообучалась (fine-tuning) на тестовых, ее результаты возрастали почти вдвое, превосходя показатели сильнейших альтернативных базовых алгоритмов. Хотя это не первый случай успешного применения трансферного обучения в RL, он очень важен, так как демонстрирует, что трансферное обучение способно давать мощный и надежный эффект.

Но нам предстоит пройти долгий путь, прежде чем наши алгоритмы смогут соперничать с людьми. Как показано выше, после двух часов практики на обучающих уровнях и одного часа игры на каждом тестовом уровне люди способны набирать результаты, значительно превосходящие те, что показывают алгоритмы RL, включая те из них, которые используют трансферное обучение.

Записи прохождения Sonic

Мы создали набор данных с записями того, как люди проходят уровни Sonic из ретро-соревнования. Эти записи можно использовать для того, чтобы агент начинал игру со случайных точек, выбранных на протяжении каждого уровня, знакомя агента со множеством зон, которые он мог бы не увидеть, если бы всегда начинал с самого начала. Исследователи также могут применять эти записи для обучения агентов на основе демонстраций.

Gym Retro Бета

Мы выпускаем Gym Retro — систему для адаптации классических видеоигр под среды обучения с подкреплением. Этот предварительный релиз включает 30 игр для SEGA Genesis из набора игр SEGA Mega Drive and Genesis Classics в Steam, а также 62 игры для Atari 2600 из Arcade Learning Environment.

Arcade Learning Environment, коллекция игр для Atari 2600 с интерфейсами для обучения с подкреплением, была основным двигателем исследований в области RL последние пять лет. Эти игры для Atari были более разнообразными и сложными, чем предыдущие бенчмарки RL, поскольку они разрабатывались так, чтобы бросить вызов моторным навыкам и способностям решать проблемы у игроков-людей.

Платформа Gym Retro Beta использует более современную консоль, чем Atari (SEGA Genesis), расширяя количество и сложность игр, доступных для исследований в области RL. Игры для Genesis обычно имеют множество уровней, которые похожи в одних аспектах (физика, внешний вид объектов) и отличаются в других (планировка, предметы), что делает их отличными полигонами для тестирования трансферного обучения. Они также, как правило, сложнее игр для Atari, поскольку задействуют более мощное аппаратное обеспечение Genesis (например, в ней более чем в 500 раз больше оперативной памяти, чем в Atari, больший диапазон возможных управляющих воздействий и поддержка улучшенной графики).

Gym Retro была вдохновлена проектом Retro Learning Environment, но спроектирована так, чтобы быть более гибкой; например, в Gym Retro вы можете указывать описание среды с помощью файлов JSON, а не кода C++, что упрощает интеграцию новых игр.

Gym Retro — это наша вторая попытка создать масштабный набор данных сред для обучения с подкреплением. В его основе лежат некоторые идеи проекта Universe конца 2016 года, однако мы не смогли добиться хороших результатов от той реализации, поскольку среды Universe работали асинхронно, могли функционировать только в реальном времени и часто были ненадежными из-за определения состояния игры по скриншотам. Gym Retro переносит модель Arcade Learning Environment на гораздо более широкий круг потенциальных игр.

Чтобы начать работу с Gym Retro, ознакомьтесь с разделом Getting Started на GitHub.

Иногда алгоритмы могут находить уязвимости в игре. Здесь политика, обученная с помощью PPO, обнаруживает, что может проскользнуть сквозь стены уровня, чтобы двигаться вправо и получить более высокий результат — еще один пример того, как конкретные функции вознаграждения могут приводить к проявлению у ИИ-агентов странного поведения.

Авторы

Кристофер Хессе (Christopher Hesse), Джон Шульман (John Schulman), Вики Пфау (Vicki Pfau), Алекс Никол (Alex Nichol), Олег Климов, Ларисса Скьяво (Larissa Schiavo)

Другие участники

Спасибо Джонатану Грею (Jonathan Gray) и Тому Брауну (Tom Brown) за их вклад в ранние версии gym-retro.

Спасибо Филиппу Морицу (Philipp Moritz), Роберту Нисихаре (Robert Nishihara), Адаму Стельмащику (Adam Stelmaszczyk), Аравинду Сринивасу (Aravind Srinivas), Цинь Юнляну (Qin Yongliang), Джулиану Тогелиусу (Julian Togelius) и Эмилио Парисотто (Emilio Parisotto) за полезные отзывы.

Обложка

Тимоти Дж. Рейнольдс (Timothy J. Reynolds)

Полный текст статьи читайте на OpenAI