Открытая бета-версия OpenAI Gym

Мы выпускаем публичную бета-версию OpenAI Gym — инструментария для разработки и сравнения алгоритмов обучения с подкреплением (RL). Он состоит из растущего набора сред (от симулированных роботов до игр Atari) и сайта для сравнения и воспроизведения результатов.
OpenAI Gym совместим с алгоритмами, написанными на любых фреймворках, таких как Tensorflow и Theano. Среды написаны на Python, но вскоре мы сделаем их удобными для использования на любом языке. Изначально мы создали OpenAI Gym как инструмент для ускорения собственных исследований в области обучения с подкреплением. Мы надеемся, что он окажется столь же полезным для широкого сообщества.
Начало работы
Если вы хотите сразу погрузиться в процесс, вы можете пройти наше руководство. Вы также можете помочь в обучении, воспроизведя результат.
Почему обучение с подкреплением?
Обучение с подкреплением (RL) — это подраздел машинного обучения, связанный с принятием решений и моторным управлением. Оно изучает, как агент может научиться достигать целей в сложной, неопределенной среде. Это направление увлекает по двум причинам:
- RL является очень универсальным методом, охватывающим все проблемы, связанные с принятием последовательности решений: например, управление моторами робота, чтобы он мог бегать и прыгать, принятие бизнес-решений вроде ценообразования и управления запасами, или прохождение видеоигр и настольных игр. RL может даже применяться к задачам обучения с учителем с последовательнымиилиструктурированными выходными данными.
- Алгоритмы RL начали показывать хорошие результаты во многих сложных средах. У RL долгая история, но до недавних достижений в глубоком обучении она требовала большого объема специфической для конкретной задачи инженерии. Результаты DeepMind в Atari, BRETT из группы Питера Аббеля (Pieter Abbeel) и AlphaGo — все они использовали алгоритмы глубокого RL, которые не делали слишком много предположений о своей среде и поэтому могут применяться в других условиях.
Тем не менее, исследования в области RL также тормозятся двумя факторами:
- Потребность в лучших бенчмарках. В обучении с учителем прогресс стимулировался крупными размеченными наборами данных, такими как ImageNet. В RL ближайшим эквивалентом была бы большая и разнообразная коллекция сред. Однако существующие коллекции сред RL с открытым исходным кодом не обладают достаточным разнообразием, и их часто трудно даже настроить и использовать.
- Отсутствие стандартизации сред, используемых в публикациях. Незначительные различия в определении проблемы, такие как функция вознаграждения или набор действий, могут кардинально изменить сложность задачи. Эта проблема затрудняет воспроизведение опубликованных исследований и сравнение результатов из разных работ.
OpenAI Gym — это попытка решить обе проблемы.
Среды
OpenAI Gym предоставляет разнообразный набор сред, которые варьируются от простых до сложных и включают множество различных типов данных. Мы начинаем со следующих коллекций:
- Классическое управление и учебный текст (toy text): выполнение мелкомасштабных задач, в основном из литературы по RL. Они здесь для того, чтобы помочь вам начать.
- Алгоритмические: выполнение таких вычислений, как сложение многозначных чисел и инвертирование последовательностей. Кто-то может возразить, что эти задачи просты для компьютера. Сложность заключается в том, чтобы выучить эти алгоритмы исключительно на примерах. Эти задачи обладают приятным свойством: сложность легко варьировать, изменяя длину последовательности.
- Atari: игра в классические игры Atari. Мы интегрировали Arcade Learning Environment (которая оказала большое влияние на исследования в области обучения с подкреплением) в простом в установке виде.
- Настольные игры: игра в го на досках 9×9 и 19×19. Игры для двух игроков принципиально отличаются от других включенных нами сред, потому что против вас играет противник. В нашем первом релизе фиксированный противник предоставляется Pachi, и позже мы можем добавить других противников (патчи приветствуются!). Мы также, вероятно, расширим OpenAI Gym, чтобы обеспечить первоклассную поддержку многопользовательских игр.
- Двумерные и трехмерные роботы: управление роботом в симуляции. В этих задачах используется физический движок MuJoCo, который был разработан для быстрого и точного моделирования роботов. Сюда входят некоторые среды из недавнего бенчмарка, созданного исследователями из UC Berkeley (которые, к слову, присоединятся к нам этим летом). MuJoCo является проприетарным программным обеспечением, но предлагает лицензии для бесплатного пробного периода.
Со временем мы планируем значительно расширить эту коллекцию сред. Вклад со стороны сообщества более чем приветствуется.
Каждая среда имеет номер версии (например, Hopper-v0). Если нам нужно изменить среду, мы увеличим номер версии, определив совершенно новую задачу. Это гарантирует, что результаты в конкретной среде всегда будут сопоставимы.
Оценки
Мы сделали удобной загрузку результатов в OpenAI Gym. Тем не менее, мы решили не создавать традиционные таблицы лидеров. Для исследований важен не ваш балл (можно переобучить модель или подогнать решения под конкретные задачи вручную), а универсальность вашего метода.
Сначала мы будем поддерживать курируемый список вкладов, которые говорят что-то интересное об алгоритмических возможностях. В долгосрочной перспективе мы хотим, чтобы это курирование стало совместной работой сообщества, а не чем-то принадлежащим нам. Нам неизбежно придется разбираться с деталями со временем, и мы были бы рады вашей помощи в этом деле.
Мы хотим, чтобы OpenAI Gym с самого начала был проектом сообщества. Мы начали работать с партнерами над созданием ресурсов вокруг OpenAI Gym:
- NVIDIA: технические вопросы и ответы (Q&A) с Джоном.
- Nervana: реализация агента DQN для OpenAI Gym.
- Amazon Web Services (AWS): ваучеры на кредит в размере 250 долларов США для отдельных пользователей OpenAI Gym. Если у вас есть оценка, демонстрирующая перспективность вашего алгоритма, и у вас ограничены ресурсы для его масштабирования, напишите нам для получения ваучера. (Пока есть в наличии!)
Во время публичного бета-тестирования мы ждем отзывов о том, как сделать этот инструмент еще лучше для исследований. Если вы хотите помочь, вы можете попробовать улучшить лучшие в своем роде результаты (state-of-the-art) в каждой среде, воспроизвести результаты других людей или даже реализовать собственные среды. Также присоединяйтесь к нашему чату сообщества!
Авторы
Полный текст статьи читайте на OpenAI
