Начало работы в глубоком скрепленном обучении (Deep RL): Обзор воркшопа
2 февраля мы провели наш первый воркшоп Spinning Up в рамках новой образовательной инициативы в OpenAI.

Мы приняли около 90 человек в нашем офисе и привлекли еще почти 300 участников через прямую трансляцию. Участники представляли самые разные сферы деятельности, включая академические круги, разработку программного обеспечения, науку о данных, машинное обучение, медицину и образование. Этот воркшоп опирался на наш пакет материалов Spinning Up in Deep RL и более глубоко погружал в темы проектирования алгоритмов обучения с подкреплением (RL), робототехники и создания безопасных систем искусственного интеллекта.

Создание образовательных инструментов
Одна из целей образовательных инициатив OpenAI — помочь людям развить навыки, необходимые для участия в исследованиях и разработках в области искусственного интеллекта, особенно в сфере глубокого обучения с подкреплением (Deep RL), которая является ключевым направлением исследований в OpenAI. Основываясь на нашем опыте работы со стипендиатами (Scholars) и ассистентами (Fellows), мы пришли к выводу, что ключевыми составляющими для развития навыков являются:
- гибкая учебная программа, включающая как базовый материал, так и обзор передовых направлений исследований;
- наставничество и обсуждения с экспертами;, а также
- работа студентов над проектами соответствующего уровня сложности, способствующая их профессиональному росту.
Главная задача образовательных программ OpenAI заключается в том, чтобы понять, как масштабировать этот подход. Если распространение учебной программы в больших масштабах относительно просто, то масштабирование наставничества и руководства проектами неочевидно. Наша рабочая гипотеза состоит в том, что воркшопы могут помочь нам в решении именно этой задачи. Наш первый воркшоп Spinning Up дал нам несколько положительных сигналов о том, что это перспективное направление, и мы рады поделиться полученным опытом.
Участники

Мы приняли около 90 человек в нашем офисе и вовлекли почти 300 участников через прямую трансляцию. Наши гости представляли самые разные сферы: академические исследования, разработку ПО, науку о данных, инженерию машинного обучения, медицину и образование. Уровень опыта в машинном обучении значительно различался у разных участников: от «почти нулевого» до «создал собственного бота для Dota!»
Более 500 человек со всего мира подали заявки на участие в этом воркшопе. К сожалению, из-за ограничений по пространству мы не смогли пригласить всех желающих, но мы намерены и дальше привлекать сообщество к нашим будущим мероприятиям.
Доклады
Воркшоп начался с трехчасовой сессии докладов. В качестве вступления Джошуа Акиам (Joshua Achiam) изложил концептуальные основы обучения с подкреплением и дал обзор различных типов RL-алгоритмов. Если вы хотите изучить этот материал самостоятельно, обратитесь к ресурсу Spinning Up in Deep RL.
Матиас Плепперт (Matthias Plappert) рассказал о недавнейработе OpenAI, посвященной обучению ловкой роборуки в симуляторе манипулированию объектами в реальном мире. Рандомизация доменов, рекуррентные нейронные сети и крупномасштабное распределенное обучение стали ключевыми компонентами для преодоления разрыва между симуляцией и реальностью (sim2real) в этой задаче.
Дарио Амодей (Dario Amodei), руководитель команды по безопасности в OpenAI, представил обзор проблем безопасности ИИ и недавнихисследованиях в этой области. Он описал центральную проблему безопасности: сложность корректного определения поведения агента! Легко непреднамеренно создать стимулы для агентов демонстрировать поведение, отличное от того, которое вам было нужно, а когда агенты становятся очень мощными, это может быть опасно. Дарио также рассказал о работе, проделанной OpenAI совместно с исследователями из DeepMind для решения этой проблемы, в рамках которой функции вознаграждения изучаются на основе человеческих предпочтений, а не проектируются вручную.
Вторая половина дня
Вторая половина дня продолжилась полуструктурированной программой хакатона и тематических секций. Участники могли получить рекомендации по идеям проектов и советы по исследовательской работе от нашей команды волонтеров, в которую вошли Аманда Аскелл (Amanda Askell), Алекс Рэй (Alex Ray), Даниэль Циглер (Daniel Ziegler), Дилан Хадфилд-Меннелл (Dylan Hadfield-Menell), Итан Найт (Ethan Knight), Карл Коббе (Karl Cobbe), Матиас Плепперт (Matthias Plappert) и Сэм МакКэндлиш (Sam McCandlish).

Тематические секции стали главным событием второй половины дня. В то время как утренние доклады охватывали концептуальные основы RL, секции были разработаны так, чтобы помочь участникам улучшить свои навыки реализации и проведения исследований.

В первой сессии Карл Коббе провел введение в TensorFlow — ключевую библиотеку, используемую в исследованиях по глубокому обучению. Во второй сессии, озаглавленной «Пишем DQN вместе» (Writing DQN Together), Даниэль Циглер провел участников по шагам через процесс реализации алгоритма глубокого RL. В третьей сессии, «Вопросы и ответы по продвинутому RL» (Advanced RL Q&A), Джошуа Акиам рассказал о последних рубежах исследований в области RL и ответил на вопросы аудитории о проведении исследований в этой сфере.

Наши выводы
Это был наш первый эксперимент с форматом воркшопа, и в целом мы остались довольны результатом. В частности, нам было очень приятно работать напрямую с такой способной и увлеченной группой участников. Этот опыт, а также отзывы участников дали нам четкое понимание того, что следует сохранить, а что изменить для будущих воркшопов.
Что сработало хорошо: мы спросили наших участников, что запомнилось им больше всего, и эти ответы представляют собой вполне показательную выборку:
«Я узнал ОЧЕНЬ МНОГОГО в очень безопасной, дружелюбной обстановке, где все находились примерно на одном уровне с точки зрения обучения».
«Мне показалось невероятно полезным то, что можно было получить индивидуальную помощь и поработать в режиме, похожем на парное программирование, с людьми, которые действительно знают, что делают. Энтузиазм волонтеров также был очень высоким, и я чувствовал себя очень уверенно, когда просил о помощи».
Подобные отзывы убедили нас в том, что формат воркшопа отлично справился с задачей обеспечения «наставничества и обсуждений с экспертами».

Что можно улучшить: мы спросили участников, что, по их мнению, мы могли бы сделать иначе для улучшения их впечатлений, и получили такие ответы:
«Мне бы хотелось, чтобы была презентация потенциальных проектов, которыми мы могли бы заняться в зависимости от нашего уровня подготовки».
«Продлить воркшоп на два дня».
Многие участники чувствовали, что либо не уверены, над чем работать во время хакатона, либо у них было недостаточно времени для значительного прогресса в своем проектном коде.
Мы считаем, что подобные отзывы являются хорошим индикатором того, что однодневного формата воркшопа недостаточно, чтобы «помочь студентам работать над проектами правильного уровня сложности для их роста» в области RL. В будущем мы рассмотрим возможность проведения более длительных мероприятий, чтобы достичь этой цели. Эти отзывы также показывают, что нам следует уделять больше внимания созданию «готовых к использованию» проектов по RL, к которым участники могли бы сразу приступить.

Что еще? Помимо технического содержания воркшопа, создание поддерживающей и инклюзивной атмосферы было для нас первостепенной задачей, и участники отмечали, как это важно для их опыта. Один из отзывов гласил:
«Это первое не эксклюзивно женское социальное мероприятие в Кремниевой долине, где в комнате было около 50% женщин. Это было настолько шокирующе, что поначалу я подумала, будто зашла не в ту комнату. Благодаря такому гендерному балансу общаться было заметно проще, так что спасибо вам за это».

Что дальше
Устав OpenAI (Charter) предписывает нам «создать глобальное сообщество, работающее вместе над решением глобальных проблем общего искусственного интеллекта (AGI)», и мы продолжим развивать образовательные инициативы OpenAI для достижения этой цели. Это включает в себя дальнейшую работу над такими ресурсами, как Spinning Up in Deep RL, и проведение новых мероприятий вроде этого воркшопа Spinning Up. В настоящее время мы планируем второй воркшоп совместно с CHAI в Беркли, о котором, как мы ожидаем, объявим в ближайшее время.
Если вы хотите помочь нам в исследованиях области RL или обучении людей искусственному интеллекту, пожалуйста, свяжитесь с нами! Мы нанимаем сотрудников.
Спасибо Мэдди Холл (Maddie Hall) и Лорен Кван (Loren Kwan) за соорганизацию мероприятия, Иэну Ате (Ian Atha) — за прямую трансляцию и запись лекций, а также за помощь участникам с проблемами в Python и TensorFlow, а такжеБлейку Такеру— за видео- и фотосъемку!
Автор
Полный текст статьи читайте на OpenAI
