Темы



Начало работы в глубоком скрепленном обучении (Deep RL): Обзор воркшопа

2 февраля мы провели наш первый воркшоп Spinning Up в рамках новой образовательной инициативы в OpenAI.

Spinning Up In Deep RL

Мы приняли около 90 человек в нашем офисе и привлекли еще почти 300 участников через прямую трансляцию. Участники представляли самые разные сферы деятельности, включая академические круги, разработку программного обеспечения, науку о данных, машинное обучение, медицину и образование. Этот воркшоп опирался на наш пакет материалов Spinning Up in Deep RL⁠ и более глубоко погружал в темы проектирования алгоритмов обучения с подкреплением (RL), робототехники и создания безопасных систем искусственного интеллекта.

Person speaking into a microphone in front of a room with a live audience

Создание образовательных инструментов

Одна из целей образовательных инициатив OpenAI — помочь людям развить навыки, необходимые для участия в исследованиях и разработках в области искусственного интеллекта, особенно в сфере глубокого обучения с подкреплением (Deep RL), которая является ключевым направлением исследований в OpenAI. Основываясь на нашем опыте работы со стипендиатами (Scholars)⁠ и ассистентами (Fellows)⁠, мы пришли к выводу, что ключевыми составляющими для развития навыков являются:

  1. гибкая учебная программа, включающая как базовый материал, так и обзор передовых направлений исследований;
  2. наставничество и обсуждения с экспертами;, а также
  3. работа студентов над проектами соответствующего уровня сложности, способствующая их профессиональному росту.

Главная задача образовательных программ OpenAI заключается в том, чтобы понять, как масштабировать этот подход. Если распространение учебной программы в больших масштабах относительно просто, то масштабирование наставничества и руководства проектами неочевидно. Наша рабочая гипотеза состоит в том, что воркшопы могут помочь нам в решении именно этой задачи. Наш первый воркшоп Spinning Up дал нам несколько положительных сигналов о том, что это перспективное направление, и мы рады поделиться полученным опытом.

Участники

A large audience listening intently while looking ahead

Мы приняли около 90 человек в нашем офисе и вовлекли почти 300 участников через прямую трансляцию. Наши гости представляли самые разные сферы: академические исследования, разработку ПО, науку о данных, инженерию машинного обучения, медицину и образование. Уровень опыта в машинном обучении значительно различался у разных участников: от «почти нулевого» до «создал собственного бота для Dota!»

Более 500 человек со всего мира подали заявки на участие в этом воркшопе. К сожалению, из-за ограничений по пространству мы не смогли пригласить всех желающих, но мы намерены и дальше привлекать сообщество к нашим будущим мероприятиям.

Доклады

Воркшоп начался с трехчасовой сессии докладов. В качестве вступления Джошуа Акиам (Joshua Achiam)⁠ изложил концептуальные основы обучения с подкреплением и дал обзор различных типов RL-алгоритмов. Если вы хотите изучить этот материал самостоятельно, обратитесь к ресурсу Spinning Up in Deep RL⁠.

Матиас Плепперт (Matthias Plappert) рассказал о недавней⁠работе⁠ OpenAI, посвященной обучению ловкой роборуки в симуляторе манипулированию объектами в реальном мире. Рандомизация доменов, рекуррентные нейронные сети и крупномасштабное распределенное обучение стали ключевыми компонентами для преодоления разрыва между симуляцией и реальностью (sim2real) в этой задаче.

Дарио Амодей (Dario Amodei), руководитель команды по безопасности в OpenAI, представил обзор проблем безопасности ИИ и недавних⁠исследованиях⁠ в этой области. Он описал центральную проблему безопасности: сложность корректного определения поведения агента! Легко непреднамеренно создать стимулы для агентов демонстрировать поведение, отличное от того, которое вам было нужно, а когда агенты становятся очень мощными, это может быть опасно. Дарио также рассказал о работе⁠, проделанной OpenAI совместно с исследователями из DeepMind для решения этой проблемы, в рамках которой функции вознаграждения изучаются на основе человеческих предпочтений, а не проектируются вручную.

Вторая половина дня

Вторая половина дня продолжилась полуструктурированной программой хакатона и тематических секций. Участники могли получить рекомендации по идеям проектов и советы по исследовательской работе от нашей команды волонтеров, в которую вошли Аманда Аскелл (Amanda Askell)⁠,  Алекс Рэй (Alex Ray)⁠,  Даниэль Циглер (Daniel Ziegler)⁠,  Дилан Хадфилд-Меннелл (Dylan Hadfield-Menell)⁠,  Итан Найт (Ethan Knight)⁠,  Карл Коббе (Karl Cobbe)⁠,  Матиас Плепперт (Matthias Plappert)⁠ и Сэм МакКэндлиш (Sam McCandlish)⁠.

A group of presenters standing in front of.a projection, facing a live audience

Тематические секции стали главным событием второй половины дня. В то время как утренние доклады охватывали концептуальные основы RL, секции были разработаны так, чтобы помочь участникам улучшить свои навыки реализации и проведения исследований.

Group of people sitting together around a table, focused on their laptops

В первой сессии Карл Коббе провел введение в TensorFlow⁠ — ключевую библиотеку, используемую в исследованиях по глубокому обучению. Во второй сессии, озаглавленной «Пишем DQN вместе» (Writing DQN Together), Даниэль Циглер провел участников по шагам через процесс реализации алгоритма глубокого RL. В третьей сессии, «Вопросы и ответы по продвинутому RL» (Advanced RL Q&A), Джошуа Акиам рассказал о последних рубежах исследований в области RL и ответил на вопросы аудитории о проведении исследований в этой сфере.

People sitting around large tables, working on their laptops, and talking in a crowded room.

Наши выводы

Это был наш первый эксперимент с форматом воркшопа, и в целом мы остались довольны результатом. В частности, нам было очень приятно работать напрямую с такой способной и увлеченной группой участников. Этот опыт, а также отзывы участников дали нам четкое понимание того, что следует сохранить, а что изменить для будущих воркшопов.

Что сработало хорошо: мы спросили наших участников, что запомнилось им больше всего, и эти ответы представляют собой вполне показательную выборку:

«Я узнал ОЧЕНЬ МНОГОГО в очень безопасной, дружелюбной обстановке, где все находились примерно на одном уровне с точки зрения обучения».

«Мне показалось невероятно полезным то, что можно было получить индивидуальную помощь и поработать в режиме, похожем на парное программирование, с людьми, которые действительно знают, что делают. Энтузиазм волонтеров также был очень высоким, и я чувствовал себя очень уверенно, когда просил о помощи».

Подобные отзывы убедили нас в том, что формат воркшопа отлично справился с задачей обеспечения «наставничества и обсуждений с экспертами».

Two people working together on their laptops

Что можно улучшить: мы спросили участников, что, по их мнению, мы могли бы сделать иначе для улучшения их впечатлений, и получили такие ответы:

«Мне бы хотелось, чтобы была презентация потенциальных проектов, которыми мы могли бы заняться в зависимости от нашего уровня подготовки».

«Продлить воркшоп на два дня».

Многие участники чувствовали, что либо не уверены, над чем работать во время хакатона, либо у них было недостаточно времени для значительного прогресса в своем проектном коде.

Мы считаем, что подобные отзывы являются хорошим индикатором того, что однодневного формата воркшопа недостаточно, чтобы «помочь студентам работать над проектами правильного уровня сложности для их роста» в области RL. В будущем мы рассмотрим возможность проведения более длительных мероприятий, чтобы достичь этой цели. Эти отзывы также показывают, что нам следует уделять больше внимания созданию «готовых к использованию» проектов по RL, к которым участники могли бы сразу приступить.

Side profile of a person sitting with earbuds in their ears, looking intently at a laptop screen of a 3D checkerboard environment

Что еще? Помимо технического содержания воркшопа, создание поддерживающей и инклюзивной атмосферы было для нас первостепенной задачей, и участники отмечали, как это важно для их опыта. Один из отзывов гласил:

«Это первое не эксклюзивно женское социальное мероприятие в Кремниевой долине, где в комнате было около 50% женщин. Это было настолько шокирующе, что поначалу я подумала, будто зашла не в ту комнату. Благодаря такому гендерному балансу общаться было заметно проще, так что спасибо вам за это».

Two people standing and talking while holding food and beverages

Что дальше

Устав OpenAI (Charter)⁠ предписывает нам «создать глобальное сообщество, работающее вместе над решением глобальных проблем общего искусственного интеллекта (AGI)», и мы продолжим развивать образовательные инициативы OpenAI для достижения этой цели. Это включает в себя дальнейшую работу над такими ресурсами, как Spinning Up in Deep RL⁠, и проведение новых мероприятий вроде этого воркшопа Spinning Up. В настоящее время мы планируем второй воркшоп совместно с CHAI в Беркли⁠, о котором, как мы ожидаем, объявим в ближайшее время.

Если вы хотите помочь нам в исследованиях области RL или обучении людей искусственному интеллекту, пожалуйста, свяжитесь с нами!  Мы нанимаем сотрудников⁠.

Спасибо Мэдди Холл (Maddie Hall) и Лорен Кван (Loren Kwan) за соорганизацию мероприятия, Иэну Ате (Ian Atha) — за прямую трансляцию и запись лекций, а также за помощь участникам с проблемами в Python и TensorFlow, а такжеБлейку Такеру⁠— за видео- и фотосъемку!

Автор

Джошуа Акиам (Joshua Achiam)

Полный текст статьи читайте на OpenAI