Обучение с подкреплением на основе предсказательных наград

Читать научную работуПосмотреть код
Screenshot of a Super Mario 2D game interface

Источник

Мы разработали дистилляцию случайных сетей (RND) — метод на основе прогнозирования, который побуждает агентов обучения с подкреплением исследовать окружение за счет любопытства. Этот метод впервые превзошел средние результаты человека в игре Montezuma«s Revenge.

Мы разработали дистилляцию случайных сетей (RND) — метод на основе прогнозирования, который побуждает агентов обучения с подкреплением исследовать окружение за счет любопытства и который впервыеA превосходит средние результаты человека в игре Montezuma«s Revenge. RND достигает передовых показателей, периодически находит все 24 комнаты и проходит первый уровень без использования демонстраций или доступа к базовому состоянию игры.

RND стимулирует посещение незнакомых состояний, измеряя сложность предсказания выхода фиксированной случайной нейронной сети для уже посещенных состояний. В незнакомых состояниях угадать выход сложно, поэтому награда высока. Метод применим к любому алгоритму обучения с подкреплением, прост в реализации и эффективен при масштабировании. Ниже мы публикуем эталонную реализацию RND, с помощью которой можно воспроизвести результаты из нашей статьи.

Прогресс в Montezuma«s Revenge

Чтобы агент достиг поставленной цели, он должен сначала изучить возможные варианты поведения в окружающей среде и понять, что именно приближает его к цели. Сигналы награды во многих играх задают обучающую последовательность, при которой даже простые стратегии исследования достаточны для выполнения задачи. В знаковой работе, представляющей DQN, игра Montezuma«s Revenge оказалась единственной, где DQN набрал 0% от среднего результата человека (4,7 тыс. очков). Простые стратегии исследования с крайне низкой вероятностью могут принести хоть какие-то награды или позволить увидеть больше нескольких комнат из 24 доступных. С тех пор успехи в Montezuma«s Revenge многими воспринимаются как синоним прогресса в области исследования среды.

Dot graph showing progress in Montezuma's Revenge

Значительный прогресс был достигнут в 2016 году путем объединения DQN с бонусом за исследование на основе подсчета посещений. Это позволило создать агента, который исследовал 15 комнат, набрал максимальное количество очков в 6,6 тыс. и среднюю награду около 3,7 тыс. С тех пор значительноеулучшение результатов агентов обучения с подкреплением достигалось только за счет использования демонстраций людей-экспертов или доступа к базовому состоянию эмулятора.

Мы провели масштабный эксперимент с RND, используя 1024 рабочих процесса параллельного сбора данных (rollout workers). В результате средняя отдача по 9 запускам составила 10 тыс. очков, а лучший средний результат достиг 14,5 тыс. Каждый запуск позволил обнаружить от 20 до 22 комнат. Кроме того, один из наших менее масштабных, но более длительных экспериментов привел к тому, что в одном из 10 запусков был достигнут лучший результат в 17,5 тыс. очков, что соответствует прохождению первого уровня и обнаружению всех 24 комнат. На графике ниже эти два эксперимента сравниваются по показателю среднего возврата в зависимости от обновлений параметров.

Graph showing mean episodic return over parameter updates

Визуализация ниже демонстрирует прогресс маломасштабного эксперимента в обнаружении комнат. Любопытство побуждает агента открывать новые комнаты и находить способы увеличения внутриигрового счета, а внешняя награда заставляет его возвращаться в эти комнаты на более поздних этапах обучения.

Масштабное исследование обучения на основе любопытства

До разработки RND мы совместно с исследователями из Калифорнийского университета в Беркли изучали обучение без каких-либо специфичных для окружения наград. Любопытство дает нам более простой способ научить агентов взаимодействовать с любой средой взамен создания детально спроектированных функций награды под конкретные задачи, которые, как мы надеемся, соответствуют решению проблемы. Такие проекты, как ALE, Universe, Malmo, Gym, Gym Retro, Unity, DeepMind Lab, CommAI, предоставляют большое количество смоделированных сред, с которыми агент может взаимодействовать через стандартизированный интерфейс. Агент, использующий общую функцию награды, не привязанную к деталям конкретной среды, может приобрести базовый уровень компетентности в самых разных условиях, что позволяет ему определять полезные модели поведения даже в отсутствие тщательно проработанных наград.

  • Читать статью
  • Посмотреть код

В стандартных схемах обучения с подкреплением на каждом дискретном временном шаге агент отправляет действие в среду, а среда отвечает, выдавая следующее наблюдение, награду за переход и индикатор окончания эпизода. В нашей предыдущей статье мы требовали, чтобы среда выдавалатолько следующее наблюдение. Там агент обучал модель предсказания следующего состояния на основе своего опыта и использовал ошибку предсказания в качестве внутренней награды. В результате его привлекало все непредсказуемое. Например, изменение счета в игре приносило награду только в том случае, если счет отображался на экране, а изменения с трудом поддавались прогнозированию. Как правило, агент находит полезным взаимодействие с новыми объектами, поскольку результаты такого взаимодействия обычно предсказать сложнее, чем другие аспекты среды.

Подобно предыдущимработам, мы постарались избежать моделирования всех аспектов окружающей среды (независимо от их важности), сосредоточившись на моделировании признаков наблюдения. Удивительно, но мы обнаружили, что даже случайные признаки работают отлично.

Что делают любопытные агенты?

Мы протестировали нашего агента более чем в 50 различных средах и наблюдали разные уровни компетентности: от кажущихся случайными действий до осознанного взаимодействия со средой. К нашему удивлению, в некоторых средах агент успешно выполнял задачу, даже если цель игры не сообщалась ему через внешнюю награду.

Breakout Агент испытывает всплески внутренней награды, когда видит новую конфигурацию кирпичей на ранних этапах обучения и когда впервые проходит уровень после нескольких часов тренировки.

Pong Мы обучили агента управлять обеими ранетками одновременно, и он научился удерживать мяч в игре, что приводило к долгим розыгрышам. Даже играя против встроенного искусственного интеллекта, агент пытался продлить игру, а не выиграть.

Bowling Агент научился играть лучше, чем агенты, обученные максимизировать прямую (обрезанную) внешнюю награду. Мы полагаем, это происходит потому, что агента привлекает трудное для предсказания мигание табло, возникающее после страйков.

Mario Внутренняя награда особенно хорошо согласуется с целью игры — продвижением по уровням. Агент получает награду за обнаружение новых областей, так как детали вновь открытой зоны невозможно предсказать. В результате агент открывает 11 уровней, находит секретные комнаты и даже побеждает боссов.

Проблема «шумящего телевизора»

Подобно игроку в казино, которого привлекают случайные выигрыши, агент иногда попадает в ловушку собственного любопытства из-за проблемы шумящего телевизора. Агент находит источник случайности в окружении и продолжает наблюдать за ним, постоянно получая высокую внутреннюю награду за такие переходы. Просмотр телевизора с белым шумом — пример подобной ловушки. Мы демонстрируем это буквально, помещая агента в лабиринт Unity с телевизором, транслирующим случайные каналы.

Хотя проблема шумящего телевизора вызывает опасения в теории, для преимущественно детерминированных сред, таких как Montezuma«s Revenge, мы ожидали, что любопытство будет побуждать агента открывать комнаты и взаимодействовать с объектами. Мы попробовали несколько вариантов любопытства на основе предсказания следующего состояния, объединив бонус за исследование с результатами игры.

В этих экспериментах агент управляет средой с помощью зашумленного контроллера, который с некоторой вероятностью повторяет последнее действие вместо текущего. Эта схема со «липкими» действиями была предложена в качестве передовой практики при обучении агентов в полностью детерминированных играх вроде Atari для предотвращения заучивания наизусть. Липкие действия делают переход из комнаты в комнату непредсказуемым.

Дистилляция случайной сети

Поскольку прогнозирование следующего состояния по своей природе подвержено проблеме «шумного телевизора», мы выделили следующие основные источники ошибок прогнозирования:

  • Фактор 1: Ошибка прогнозирования высока там, где предсказатель не справляется с обобщением на основе ранее увиденных примеров. Новый опыт в этом случае соответствует высокой ошибке прогнозирования.
  • Фактор 2: Ошибка прогнозирования высока из-за того, что целевой показатель прогноза является стохастическим.
  • Фактор 3: Ошибка прогнозирования высока, так как для прогноза не хватает необходимой информации, либо класс моделей предсказателей слишком ограничен, чтобы соответствовать сложности целевой функции.

Мы выяснили, что Фактор 1 является полезным источником ошибки, поскольку он количественно оценивает новизну опыта, в то время как Факторы 2 и 3 вызывают проблему «шумного телевизора». Чтобы избежать Факторов 2 и 3, мы разработали RND — новый бонус за исследование, который основан на прогнозировании выхода фиксированной и случайно инициализированной нейронной сети для следующего состояния на основе самого этого следующего состояния.

Nextstate Vs Rnd Stacked 5

Интуиция подсказывает, что предиктивные модели дают небольшую ошибку в состояниях, похожих на те, на которых они обучались. В частности, предсказания агентом выхода случайно инициализированной нейронной сети будут менее точными в новых состояниях, чем в тех, которые агент посещал часто. Преимущество использования задачи синтетического прогнозирования заключается в том, что мы можем сделать ее детерминированной (минуя Фактор 2) и находящейся в пределах класса функций, которые может представлять предсказатель (минуя Фактор 3), выбрав для предсказателя ту же архитектуру, что и у целевой сети. Такой подход делает RND невосприимчивой к проблеме «шумного телевизора».

Мы объединяем бонус за исследование с внешними наградами с помощью варианта проксимальной оптимизации политики (PPO), в котором используются две ценностные «головы» для двух потоков наград. Это позволяет нам применять разные коэффициенты дисконтирования для разных наград и объединять эпизодические и неэпизодические возвраты. Обладая такой дополнительной гибкостью, наш лучший агент часто находит 22 из 24 комнат на первом уровне в игре Montezuma«s Revenge и временами проходит первый уровень после обнаружения оставшихся двух комнат. Тот же метод обеспечивает производительность на уровне передовых достижений (state-of-the-art) в играх Venture и Gravitar.

Six graphs comparing game score of PPO and RND

Визуализация бонуса RND ниже представляет собой график внутренней награды в ходе прохождения одного из эпизодов игры Montezuma«s Revenge, в котором агент впервые находит факел.

Реализация имеет значение

Общие соображения, такие как восприимчивость к проблеме «шумного телевизора», важны при выборе хорошего алгоритма исследования. Тем не менее, мы обнаружили, что правильный учет кажущихся незначительными деталей в нашем простом алгоритме определял разницу между агентом, который никогда не покидает первую комнату, и агентом, способным пройти первый уровень. Чтобы повысить стабильность обучения, мы избегали насыщения признаков и привели внутренние награды к предсказуемому диапазону. Мы также заметили значительные улучшения в производительности RND каждый раз, когда мы обнаруживали и исправляли ошибку (наша любимая была связана со случайным обнулением массива, из-за чего внешние возвраты воспринимались как неэпизодические; мы поняли это только после того, как были озадачены тем, что функция внешней ценности выглядела подозрительно периодической). Внимание к таким деталям сыграло важнейшую роль в достижении высокой производительности даже при использовании алгоритмов, концептуально похожих на предыдущие работы. Это одна из причин отдавать предпочтение более простым алгоритмам, где это возможно.

Будущие направления

Мы предлагаем следующие пути для дальнейших исследований:

  • Проанализировать преимущества различных методов исследования и найти новые способы их комбинирования.
  • Обучить любознательного агента во множестве различных сред без наград и исследовать перенос навыков в целевые среды с наградами.
  • Исследовать глобальное исследование, предполагающее скоординированные решения на больших временных горизонтах.

Если вам интересно работать над преодолением этих трудностей,  подайте заявку на работу с нами!

Сноски

  1. A

    Существует анонимная заявка на ICLR, опубликованная одновременно с нашей работой, которая превосходит человеческие результаты, хотя и не в такой степени.

Авторы

Юра Бурда (Yura Burda), Харри Эдвардс (Harri Edwards)

Благодарности тем, кто внес вклад в эти статьи и этот пост в блоге:

Масштабное исследование обучения на основе любопытства: Юрий Бурда*, Харрисон Эдвардс*, Дипак Патхак*, Амос Сторки, Тревор Даррелл, Алексей А. Эфрос

Исследование с помощью дистилляции случайной сети: Юрий Бурда*, Харрисон Эдвардс*, Амос Сторки, Олег Климов

Равный вклад:

Пост в блоге: Карл Коббе, Алекс Никол, Джошуа Ахиам, Филлип Изола, Алекс Рэй, Йонас Шнайдер, Джек Кларк, Грег Брокман, Илья Суцкевер, Бен Барри, Амос Сторки, Алексей Эфрос, Дипак Патхак, Тревор Даррелл, Эндрю Брок, Антреас Антониу, Станислав Ястшембский, Эшли Пилиписин, Джастин Джей Ванг

Полный текст статьи читайте на OpenAI