Освоение глубинного обучения с подкреплением

Иллюстрация: Леандро Кастелао (Leandro Castelao)
Мы выпускаем ресурс Spinning Up in Deep RL — учебный материал, созданный для того, чтобы каждый мог стать квалифицированным специалистом в области глубинного обучения с подкреплением (Deep Reinforcement Learning). Spinning Up включает в себя предельно понятные примеры кода для RL, учебные упражнения, документацию и руководства.
В OpenAI мы верим, что глубинное обучение в целом и глубинное обучение с подкреплением в частности сыграют ключевую роль в разработке мощных технологий искусственного интеллекта. Хотя существует множество ресурсов, позволяющих быстро освоить глубинное обучение, вникнуть в глубинное обучение с подкреплением гораздо сложнее. Мы разработали Spinning Up, чтобы помочь людям научиться использовать эти технологии и развить интуитивное понимание их работы.
На создание Spinning Up нас вдохновила работа с инициативами OpenAI Scholars (Стипендиаты) и Fellows (Стажеры-исследователи). Мы заметили, что люди с минимальным опытом в машинном обучении или вообще без него могут быстро стать практикующими специалистами при наличии правильного руководства и ресурсов. Пакет Spinning Up в Deep RL создан с учетом этой потребности и интегрирован в учебную программу для потоков 2019 года для стипендиатов и стажеров.
Мы также убедились, что компетентность в области RL помогает людям участвовать в междисциплинарных исследованиях, таких как безопасность ИИ, которые требуют сочетания навыков обучения с подкреплением и других областей. К нам поступало так много просьб о помощи в изучении RL с нуля, что мы решили формализовать те неофициальные советы, которые давали раньше.
Spinning Up в Deep RL состоит из следующих основных компонентов:
- Краткое введение в терминологию RL, типы алгоритмов и базовую теорию.
- Эссе о том, как развиваться в качестве исследователя в области RL.
- Подборка важных научных работ, структурированная по темам.
- Хорошо документированный репозиторий кода с короткими автономными реализациями следующих алгоритмов: Vanilla Policy Gradient (VPG), Trust Region Policy Optimization (TRPO), Proximal Policy Optimization (PPO), Deep Deterministic Policy Gradient (DDPG), Twin Delayed DDPG (TD3) и Soft Actor-Critic (SAC).
- И несколько упражнений для разминки.
Поддержка
Мы планируем оказывать проекту следующую поддержку:
- Период интенсивной программной поддержки: В течение первых трех недель после релиза мы будем оперативно устранять баги, решать проблемы с установкой, а также исправлять ошибки или неточности в документации. Мы приложим все усилия для оптимизации пользовательского опыта, чтобы самостоятельное изучение Spinning Up было максимально простым.
- Крупный пересмотр в апреле 2019 года: Примерно через шесть месяцев после релиза мы проведем серьезный анализ состояния пакета на основе отзывов сообщества и объявим о планах по его дальнейшей модификации.
- Публикация внутренних наработок: Если в процессе работы со стипендиатами и стажерами мы будем вносить изменения в Spinning Up in Deep RL, мы будем отправлять их в публичный репозиторий, делая их сразу доступными для всех.
Обучение в OpenAI
Spinning Up in Deep RL является частью новой образовательной инициативы OpenAI, которую мы запускаем для выполнения одного из принципов Устава OpenAI: «стремиться к созданию глобального сообщества, работающего вместе над решением глобальных проблем общего искусственного интеллекта (AGI)». Мы надеемся, что Spinning Up позволит большему количеству людей познакомиться с глубинным обучением с подкреплением и использовать его для создания безопасного и приносящего пользу всему человечеству ИИ.

2 февраля 2019 года мы проведем воркшоп по Spinning Up in Deep RL в офисе OpenAI в Сан-Франциско. Воркшоп будет состоять из 3 часов лекционного материала и 5 часов полуструктурированной практики, разработки проектов и секционных заседаний — все это при поддержке технических специалистов OpenAI. Идеальные участники — это люди с опытом разработки ПО, которые уже пробовали силы в машинном обучении, однако формальный опыт в МО не обязателен. Если вы хотите принять участие, пожалуйста, заполните нашу короткую заявку здесь. Прием заявок завершится 8 декабря 2018 года, а уведомления о зачислении будут разосланы 17 декабря 2018 года.
Если вы хотите помочь нам раздвинуть границы возможностей ИИ, одновременно обучая других и делясь знаниями, подумайте о том, чтобы устроиться на работу в OpenAI.
Партнерство
Мы также будем сотрудничать с другими организациями, чтобы обучать людей с помощью этих материалов. В рамках нашего первого партнерства мы работаем с Центром человеко-совместимого ИИ (CHAI) при Калифорнийском университете в Беркли над проведением воркшопа по глубинному RL в начале 2019 года, аналогичного запланированному воркшопу Spinning Up в OpenAI. Мы надеемся, что это станет началом долгого сотрудничества.

Привет, мир
Лучший способ понять, как работают алгоритмы глубинного RL — просто запустить их. Со Spinning Up это невероятно просто:
Обычный текст
1python -m spinup.run ppo --env CartPole-v1 --exp_name hello_worldПо завершении обучения вы получите инструкции о том, как просмотреть данные экспериментов и посмотреть видеоролики с обученным агентом.
Реализации в Spinning Up совместимы с окружениями Gym из наборов задач Classic Control, Box2D или MuJoCo.
Мы разрабатывали код для Spinning Up с учетом интересов новичков, сделав его лаконичным, понятным и максимально простым для изучения. Наша цель заключалась в создании минималистичных реализаций, демонстрирующих превращение теории в код, избегая слоев абстракции и запутанности, которые обычно присущи библиотекам глубокого RL. Мы отдаем предпочтение ясности, а не модульности — повторное использование кода между реализациями строго ограничено утилитами для ведения логов и распараллеливания. Код снабжен комментариями, чтобы вы всегда понимали, что происходит, и поддерживается справочными материалами (и псевдокодом) на соответствующей странице readthedocs.
Автор
Благодарности
Спасибо всем, кто внес свой вклад в этот запуск: Алексу Рею (Alex Ray), Аманде Аскелл (Amanda Askell), Эшли Пилиписин (Ashley Pilipiszyn), Бену Гарфинкелю (Ben Garfinkel), Катрин Ольссон (Catherine Olsson), Кристи Деннисон (Christy Dennison), Колин Девин (Coline Devin), Даниэлю Цейглеру (Daniel Zeigler), Дилану Хадфилд-Менеллу (Dylan Hadfield-Menell), Эрику Сиглеру (Eric Sigler), Ге Яну (Ge Yang), Грегу Хану (Greg Khan), Иану Эта (Ian Atha), Джеку Кларку (Jack Clark), Йонасу Ротфуссу (Jonas Rothfuss), Лариссе Скьяво (Larissa Schiavo), Леандро Кастелао (Leandro Castelao), Лилиан Венг (Lilian Weng), Мэдди Холл (Maddie Hall), Маттиасу Плапперту (Matthias Plappert), Майлзу Брандаджу (Miles Brundage), Питеру Зохову (Peter Zokhov) и Питеру Аббелю (Pieter Abbeel).
Полный текст статьи читайте на OpenAI
