Соревнования Procgen и MineRL

Мы рады сообщить, что OpenAI выступает соорганизатором двух соревнований в рамках NeurIPS 2020 совместно с AIcrowd, Университетом Карнеги — Меллона и DeepMind с использованием Procgen Benchmark и MineRL.

Procgen MineRL Competitions

Мы рады сообщить, что OpenAI выступает соорганизатором двух соревнований в рамках NeurIPS 2020 совместно с AIcrowd, Университетом Карнеги — Меллона и DeepMind с использованием Procgen Benchmark и MineRL. Мы активно используем эти среды для внутренних исследований в области обучения с подкреплением и с нетерпением ждем успехов, которых сообщество добьется в этих сложных соревнованиях.

Соревнование Procgen

Соревнование Procgen Competition направлено на повышение эффективности использования выборок и способности к генерализации в обучении с подкреплением. Участники будут пытаться максимизировать производительность агентов, используя фиксированное количество взаимодействий со средой. Агенты будут оцениваться в каждой из 16 сред, уже публично выпущенных в Procgen Benchmark, а также в четырех секретных тестовых средах, созданных специально для этого соревнования. Собирая показатели производительности в таком большом количестве разнообразных сред, мы получаем высококачественные метрики для оценки базовых алгоритмов. Более подробную информацию о каждом раунде можно найти здесь.

Поскольку весь контент генерируется процедурно, каждая среда Procgen изначально требует от агентов генерализации в никогда ранее не встречавшихся ситуациях. Таким образом, эти среды обеспечивают надежную проверку способности агента к обучению в самых разных условиях. Более того, мы сделали среды Procgen быстрыми и простыми в использовании. Участники с ограниченными вычислительными ресурсами смогут легко воспроизвести наши базовые результаты и запустить новые эксперименты. Мы надеемся, что это позволит участникам быстро внедрять новые методы для улучшения эффективности выборок и генерализации в обучении с подкреплением (RL).

  • Зарегистрироваться на Procgen

Соревнование MineRL

Многие недавние знаменитые достижения в области искусственного интеллекта, такие как AlphaStar, AlphaGo и наша собственная система OpenAI Five, используют глубокое обучение с подкреплением для достижения человеческого или сверхчеловеческого уровня производительности в задачах последовательного принятия решений. До сих пор эти улучшения современного уровня требовали экспоненциально растущего объема вычислений и выборок симулятора, поэтому сложноA напрямую применять многие из этих систем к реальным проблемам, где выборки из среды обходятся дорого. Один из хорошо известных способов снизить сложность выборок среды — использовать человеческие априорные знания и демонстрации желаемого поведения.

Чтобы и дальше стимулировать исследования в этом направлении, мы выступаем соорганизатором соревнования MineRL 2020, цель которого — способствовать разработке алгоритмов, способных эффективно использовать демонстрации людей для радикального сокращения количества выборок, необходимых для решения сложных, иерархических сред с редкими наградами. Для этого участники будут соревноваться в создании систем, способных добыть алмаз в Minecraft на основе исходных пикселей, используя всего 8 000 000 выборок из симулятора MineRL и 4 дня обучения на машине с одним графическим процессором. Участникам будет предоставлен набор данных MineRL-v0 (сайт,  статья) — крупномасштабная коллекция, содержащая более 60 миллионов кадров человеческих демонстраций, что позволяет им использовать траектории экспертов для минимизации взаимодействия своего алгоритма с симулятором Minecraft.

Это соревнование является продолжением соревнования MineRL 2019, в рамках которого агент команды-победителя смог получить железную кирку (предпоследняя цель соревнования) при столь жестко ограниченном бюджете на вычисления и взаимодействие с симулятором. Если посмотреть на это в перспективе, современные стандартные системы обучения с подкреплением требуют сотен миллионов взаимодействий со средой на крупных мульти-GPU системах для достижения той же цели. В этом году мы ожидаем, что участники продвинут передовой опыт еще дальше.

Чтобы гарантировать, что участники разрабатывают действительно эффективные с точки зрения выборок алгоритмы, организаторы соревнования MineRL обучают модели команды-победителя финального раунда с нуля при строгих ограничениях на доступное аппаратное обеспечение, вычислительные мощности и взаимодействие с симулятором. Соревнование MineRL 2020 также включает в себя новое средство для предотвращения ручного проектирования признаков и переобучения решений под конкретную предметную область. Более подробную информацию о структуре соревнования можно найти здесь.

  • Зарегистрироваться на MineRL

Сноски

  1. A

    Хотя прямое применение невозможно из-за огромного количества необходимых выборок, методы переноса из симуляции в реальный мир (Sim2Real) и аугментации данных могут снизить потребность в непосредственной выборке динамики реального мира.

Автор

OpenAI

Полный текст статьи читайте на OpenAI