OpenAI Five побеждает чемпионов мира по Dota 2

OpenAI Five стала первой системой ИИ, которой удалось победить мировых чемпионов в киберспортивной дисциплине. Она выиграла два матча подряд у команды — чемпиона мира по Dota 2, OG, в рамках финала в эти выходные. И OpenAI Five, и AlphaStar от DeepMind ранее уже побеждали сильных профессионалов в закрытых матчах, но проигрывали публичные игры. Таким образом, это также первый случай, когда ИИ победил профессиональных киберспортсменов в прямом эфире.

На мероприятии OpenAI Five Finals мы также преподнесли два сюрприза:
- OpenAI Five продемонстрировала базовую способность быть командным игроком для людей, несмотря на то, что процесс ее обучения был направлен исключительно на победу над другими ботами. То, как легко мы превратили соревнующийся ИИ в кооперативный, дает нам надежду, что будущие системы ИИ смогут приносить большую пользу людям при условии целенаправленной разработки.
- С 18 по 21 апреля мы масштабируем OpenAI Five для игры в интернете, выступая как в роли соперника, так и в роли наглядного товарища по команде. Этот финальный тест позволит нам ответить на важный исследовательский вопрос: в какой степени OpenAI Five уязвима для эксплойтов или поддается надежному обыгрышу. Кроме того, это потенциально крупнейшее развертывание высококомпетентного агента глубокого обучения с подкреплением, с которым люди могут осознанно взаимодействовать.
- Повторы и интерфейс планирования OpenAI Five
Почему именно Dota?
Мы начали работу над OpenAI Five, чтобы решить задачу, которая казалась недосягаемой для существующих алгоритмов глубокого обучения с подкреплением
Для создания OpenAI Five мы разработали систему под названием Rapid, которая позволила нам запускать алгоритм PPO в беспрецедентных ранее масштабах. Результаты превзошли самые смелые ожидания: мы создали бота для Dota мирового уровня, не столкнувшись ни с какими фундаментальными ограничениями производительности.
Удивительная мощь современных алгоритмов обучения с подкреплением достигается за счет колоссального объема опыта, что может быть непрактично за пределами игры или симуляции. Это ограничение не так страшно, как звучит — например, мы использовали Rapid для управления роботизированной рукой, которая ловко поворачивает кубик (обучение полностью происходило в симуляции, а выполнялось на физическом роботе). Тем не менее, мы считаем сокращение объема необходимого опыта следующей задачей для обучения с подкреплением.
Сегодня мы отправляем OpenAI Five «на пенсию» в качестве игрока-соперника, но достигнутый прогресс и разработанные технологии продолжат определять нашу будущую работу. Это не конец наших исследований в области Dota — мы считаем, что эта игра представляет собой гораздо более интересную, сложную (и теперь хорошо изученную!) среду для развития обучения с подкреплением, чем те стандартные среды, которые используются сегодня.
Вычислительные мощности
Субботние победы OpenAI Five по сравнению с ее поражениями на турнире The International 2018 обусловлены главным изменением: 8-кратным увеличением вычислительных мощностей для обучения. На многих предыдущих этапах проекта мы обеспечивали дальнейший прогресс за счет масштабирования обучения. Но после The International мы уже выделили подавляющее большинство вычислительных ресурсов проекта на обучение одной-единственной модели OpenAI Five. Поэтому мы увеличили масштаб вычислений единственным доступным нам способом — стали обучать модель дольше.
В общей сложности текущая версия OpenAI Five потребила 800 петафлопс-дней вычислений и накопила около 45 000 лет опыта в матчах с самой собой за 10 месяцев реального времени (по сравнению с примерно 10 000 годами за 1,5 месяца реального времени на момент The International), что составляет в среднем 250 лет симулированного игрового опыта в день. Версия OpenAI Five для Finals имеет винрейт 99,9% по сравнению с версией для TI.
Трансферное обучение
Текущая версия OpenAI Five непрерывно обучается с июня 2018 года, несмотря на изменения размера модели и правил игры (включая довольно крупные патчи с обновлениями игры и добавление новых функций). В каждом случае мы могли переносить модель и продолжать обучение — что представляет собой открытую проблему для обучения с подкреплением в других областях. Насколько нам известно, это первый случай, когда агент обучения с подкреплением обучался в рамках столь долгосрочного непрерывного процесса.
Чтобы это работало, мы продолжали совершенствовать наш инструментарий хирургического вмешательства в модель, что позволяет нам использовать уже обученные параметры даже после существенных изменений архитектуры.
Больше героев
Мы практически не заметили замедления обучения при переходе от 5 к 18 героям. Мы предполагали, что то же самое будет справедливо и для большего числа героев, и после The International вложили много сил в интеграцию новых персонажей.
Мы потратили несколько недель на обучение с пулом, насчитывающим до 25 героев, доведя их уровень игры примерно до 5k MMR (около 95-го перцентиля игроков в Dota). Хотя они продолжали совершенствоваться, они обучались недостаточно быстро, чтобы достичь профессионального уровня к финалу. У нас пока не было времени выяснить почему, но наши предположения варьируются от недостаточной емкости модели до необходимости лучшего подбора матчей (matchmaking) для расширенного пула героев или требования большего времени обучения для новых героев, чтобы догнать старых. Представьте себе, как сложно человеку освоить нового героя, когда все остальные уже в совершенстве владеют своими!
Мы верим, что эти проблемы принципиально решаемы, и их решение само по себе может быть интересным. Финальная версия играет на 17 героях — мы убрали Лича, поскольку его способности претерпели значительные изменения в патче Dota 7.20.
Кооперативный режим
Это на самом деле было приятно; в какой-то момент мой Вайпер пожертвовал собой ради меня. Он попытался помочь мне, думая: «Она-то наверняка знает, что делает», а я, конечно же, не знала. Но, понимаете, он верил в меня. Я редко такое вижу у [человеческих] тиммейтов. —Шивер (Sheever)

Способность OpenAI Five играть вместе с людьми открывает убедительное видение будущего взаимодействия человека и ИИ — такого будущего, где системы искусственного интеллекта сотрудничают и улучшают человеческий опыт. Наши тестеры отмечали, что чувствовали поддержку со стороны ботов-союзников, учились, играя бок о бок с этими продвинутыми системами, и в целом получали от этого удовольствие.
Обратите внимание, что OpenAI Five демонстрирует zero-shot трансферное обучение (обучение с нулевым попаданием в распределение) — модель обучалась управлять всеми героями с помощью копий самой себя, но успешно обобщает навыки на управление подмножеством героев при игре с людьми или против них. Мы были очень удивлены тем, насколько хорошо это сработало. На самом деле, мы рассматривали возможность проведения кооперативного матча на The International, но предполагали, что для этого потребуется специальное обучение.
Арена
Мы запускаем OpenAI Five Arena — публичный эксперимент, в рамках которого каждый желающий сможет сыграть против или вместе с OpenAI Five как в соревновательном, так и в кооперативном режимах. Мы знали, что нашего бота для формата 1 на 1 можно обмануть хитроумными стратегиями; мы не знаем, в какой степени это справедливо для OpenAI Five, но мы рады пригласить сообщество помочь нам это выяснить!
Аренаоткрывается в четверг, 18 апреля, в 18:00 по тихоокеанскому времени и закроется в воскресенье, 21 апреля, в 23:59 по тихоокеанскому времени. Пожалуйста, зарегистрируйтесь, чтобы мы могли гарантировать достаточную емкость серверов в вашем регионе! Результаты всех игр будут автоматически передаваться в публичную таблицу лидеров Арены.

Мы невероятно благодарны за всю поддержку, которую сообщество Dota оказывало нам на протяжении последних двух лет, и мы надеемся, что Арена станет еще одним небольшим способом отблагодарить вас. Желаем вам приятной игры!
Что дальше
Мы опубликуем более технический анализ OpenAI Five после того, как изучим результаты проведения OpenAI Five Arena.
После этого мы продолжим работу со средой Dota 2 в рамках OpenAI. За последние два года мы наблюдали стремительный прогресс в возможностях обучения с подкреплением и считаем, что Dota 2 и дальше будет помогать нам расширять границы возможного — будь то достижение высокой эффективности при меньшем количестве данных или истинное сотрудничество между человеком и ИИ.
Если вам интересны исследования возможностей искусственного интеллекта и вы хотите помочь в реализации нашей миссии по обеспечению его безопасности на благо человечества, мы нанимаем сотрудников!
Сноски
Автор
Реплеи игр и виды планирования
Игра 1 с OG: Реплей, Вид планирования OpenAI FiveИгра 2 с OG: Реплей, Вид планирования OpenAI FiveСовместная игра: Реплей, Вид планирования OpenAI FiveЛегенда вида планирования
Полный текст статьи читайте на OpenAI
