Темы



Открытая бета-версия OpenAI Gym

Читать документ
Openai Gym Beta

Мы выпускаем публичную бета-версию OpenAI Gym — инструментария для разработки и сравнения алгоритмов обучения с подкреплением (RL). Он состоит из растущего набора сред (от симулированных роботов до игр Atari) и сайта для сравнения и воспроизведения результатов.

OpenAI Gym совместим с алгоритмами, написанными на любых фреймворках, таких как Tensorflow⁠ и Theano⁠. Среды написаны на Python, но вскоре мы сделаем их удобными для использования на любом языке. Изначально мы создали OpenAI Gym как инструмент для ускорения собственных исследований в области обучения с подкреплением. Мы надеемся, что он окажется столь же полезным для широкого сообщества.

Начало работы

Если вы хотите сразу погрузиться в процесс, вы можете пройти наше руководство⁠. Вы также можете помочь в обучении,  воспроизведя результат⁠.

Почему обучение с подкреплением?

Обучение с подкреплением (RL) — это подраздел машинного обучения, связанный с принятием решений и моторным управлением. Оно изучает, как агент может научиться достигать целей в сложной, неопределенной среде. Это направление увлекает по двум причинам:

  • RL является очень универсальным методом, охватывающим все проблемы, связанные с принятием последовательности решений:  например, управление моторами робота, чтобы он мог бегать⁠ и прыгать⁠, принятие бизнес-решений вроде ценообразования и управления запасами, или прохождение видеоигр⁠ и настольных игр⁠. RL может даже применяться к задачам обучения с учителем с последовательными⁠или⁠структурированными⁠ выходными данными.
  • Алгоритмы RL начали показывать хорошие результаты во многих сложных средах. У RL долгая история, но до недавних достижений в глубоком обучении она требовала большого объема специфической для конкретной задачи инженерии. Результаты DeepMind в Atari⁠,  BRETT⁠ из группы Питера Аббеля (Pieter Abbeel)⁠ и AlphaGo⁠ — все они использовали алгоритмы глубокого RL, которые не делали слишком много предположений о своей среде и поэтому могут применяться в других условиях.

Тем не менее, исследования в области RL также тормозятся двумя факторами:

  • Потребность в лучших бенчмарках. В обучении с учителем прогресс стимулировался крупными размеченными наборами данных, такими как ImageNet⁠. В RL ближайшим эквивалентом была бы большая и разнообразная коллекция сред. Однако существующие коллекции сред RL с открытым исходным кодом не обладают достаточным разнообразием, и их часто трудно даже настроить и использовать.
  • Отсутствие стандартизации сред, используемых в публикациях. Незначительные различия в определении проблемы, такие как функция вознаграждения или набор действий, могут кардинально изменить сложность задачи. Эта проблема затрудняет воспроизведение опубликованных исследований и сравнение результатов из разных работ.

OpenAI Gym — это попытка решить обе проблемы.

Среды

OpenAI Gym предоставляет разнообразный набор сред, которые варьируются от простых до сложных и включают множество различных типов данных. Мы начинаем со следующих коллекций:

  • Классическое управление⁠ и учебный текст (toy text)⁠: выполнение мелкомасштабных задач, в основном из литературы по RL. Они здесь для того, чтобы помочь вам начать.
  • Алгоритмические⁠: выполнение таких вычислений, как сложение многозначных чисел и инвертирование последовательностей. Кто-то может возразить, что эти задачи просты для компьютера. Сложность заключается в том, чтобы выучить эти алгоритмы исключительно на примерах. Эти задачи обладают приятным свойством: сложность легко варьировать, изменяя длину последовательности.
  • Atari⁠: игра в классические игры Atari. Мы интегрировали Arcade Learning Environment⁠ (которая оказала большое влияние на исследования в области обучения с подкреплением) в простом в установке⁠ виде.
  • Настольные игры⁠: игра в го на досках 9×9 и 19×19. Игры для двух игроков принципиально отличаются от других включенных нами сред, потому что против вас играет противник. В нашем первом релизе фиксированный противник предоставляется Pachi⁠, и позже мы можем добавить других противников (патчи приветствуются!). Мы также, вероятно, расширим OpenAI Gym, чтобы обеспечить первоклассную поддержку многопользовательских игр.
  • Двумерные и трехмерные роботы⁠: управление роботом в симуляции. В этих задачах используется физический движок MuJoCo⁠, который был разработан для быстрого и точного моделирования роботов. Сюда входят некоторые среды из недавнего бенчмарка⁠, созданного исследователями из UC Berkeley (которые, к слову,  присоединятся к нам⁠ этим летом). MuJoCo является проприетарным программным обеспечением, но предлагает лицензии для бесплатного пробного периода⁠.

Со временем мы планируем значительно расширить эту коллекцию сред. Вклад со стороны сообщества более чем приветствуется.

Каждая среда имеет номер версии (например,  Hopper-v0⁠). Если нам нужно изменить среду, мы увеличим номер версии, определив совершенно новую задачу. Это гарантирует, что результаты в конкретной среде всегда будут сопоставимы.

Оценки

Мы сделали удобной загрузку результатов⁠ в OpenAI Gym. Тем не менее, мы решили не создавать традиционные таблицы лидеров. Для исследований важен не ваш балл (можно переобучить модель или подогнать решения под конкретные задачи вручную), а универсальность вашего метода.

Сначала мы будем поддерживать курируемый список⁠ вкладов, которые говорят что-то интересное об алгоритмических возможностях. В долгосрочной перспективе мы хотим, чтобы это курирование стало совместной работой сообщества, а не чем-то принадлежащим нам. Нам неизбежно придется разбираться с деталями со временем, и мы были бы рады вашей помощи⁠ в этом деле.

Мы хотим, чтобы OpenAI Gym с самого начала был проектом сообщества. Мы начали работать с партнерами над созданием ресурсов вокруг OpenAI Gym:

  • NVIDIA⁠: технические вопросы и ответы (Q&A)⁠ с Джоном.
  • Nervana⁠: реализация агента DQN для OpenAI Gym⁠.
  • Amazon Web Services (AWS)⁠: ваучеры на кредит в размере 250 долларов США для отдельных пользователей OpenAI Gym. Если у вас есть оценка, демонстрирующая перспективность вашего алгоритма, и у вас ограничены ресурсы для его масштабирования,  напишите нам⁠ для получения ваучера. (Пока есть в наличии!)

Во время публичного бета-тестирования мы ждем отзывов о том, как сделать этот инструмент еще лучше для исследований. Если вы хотите помочь, вы можете попробовать улучшить лучшие в своем роде результаты (state-of-the-art) в каждой среде, воспроизвести результаты других людей или даже реализовать собственные среды. Также присоединяйтесь к нашему чату сообщества⁠!

Авторы

Грег Брокман (Greg Brockman)

Полный текст статьи читайте на OpenAI