Safety Gym
Мы выпускаем Safety Gym — набор сред и инструментов для измерения прогресса в создании агентов обучения с подкреплением, которые соблюдают требования безопасности в процессе обучения.

Иллюстрация: Ричард Перес и Дженнифер ДеРоса
Мы также предоставляем стандартизированный метод сравнения алгоритмов и оценки того, насколько успешно они избегают дорогостоящих ошибок в процессе обучения. Если глубокое обучение с подкреплением применяется в реальном мире — будь то в робототехнике или интернет-задачах — крайне важно иметь алгоритмы, безопасные даже во время обучения. Например, как самоходный автомобиль, который учится избегать аварий без необходимости действительно попадать в них.
Исследование сопряжено с рисками
Агентам обучения с подкреплением необходимо исследовать окружающую среду, чтобы изучить оптимальное поведение. По сути, они работают по принципу проб и ошибок: они пробуют разные варианты, смотрят, что работает, а что нет, а затем увеличивают вероятность хорошего поведения и уменьшают вероятность плохого. Однако исследование является фундаментальнорискованным: агенты могут опробовать опасные модели поведения, которые приводят к недопустимым ошибкам. Это и есть проблема «безопасного исследования» в двух словах.
Рассмотрим пример автономного роборука на заводе, использующего обучение с подкреплением (RL), чтобы научиться собирать детали. На начальном этапе обучения RL робот может начать беспорядочно махать манипулятором, так как еще не знает, что делать. Это создает угрозу безопасности для людей, работающих поблизости, поскольку они могут получить удар.
Для таких ограниченных примеров, как роборука, мы можем представить простые способы защиты людей от вреда: просто держать их на безопасном расстоянии, отключать робота, когда человек подходит слишком близко, или огородить робота барьером. Но для общих систем RL, работающих в более широком диапазоне условий, простые физические вмешательства не всегда возможны, и нам потребуется рассмотреть другие подходы к безопасному исследованию.
Обучение с подкреплением с ограничениями
Первый шаг к решению такой проблемы, как безопасное исследование, — это её количественная оценка: определить, что можно измерить и как движение вверх или вниз по этим метрикам приближает нас к желаемому результату. Иными словами, нам нужно выбрать формализм для проблемы безопасного исследования. Формализм позволяет нам разрабатывать алгоритмы, которые достигают наших целей.
Хотя существует несколько вариантов, в области исследований безопасного исследования пока нет универсального консенсуса относительно правильного формализма. Мы уделили этому время, и формализм, который, по нашему мнению, имеет наибольший смысл принять, — это обучение с подкреплением с ограничениями.
Обучение с подкреплением с ограничениями (Constrained RL) похоже на обычное RL, но помимо функции вознаграждения, которую агент хочет максимизировать, среды имеют функции стоимости, которые агент должен ограничивать. Например, рассмотрим агента, управляющего самоходным автомобилем. Мы хотели бы вознаграждать этого агента за доставку из пункта А в пункт Б как можно быстрее. Но, естественно, мы также хотели бы ограничить манеру вождения стандартами безопасности дорожного движения.
Мы полагаем, что Constrained RL может оказаться более полезным, чем обычное RL, для обеспечения соответствия агентов требованиям безопасности. Большая проблема обычного RL заключается в том, что все аспекты будущего поведения агента описываются функцией вознаграждения, однако проектирование вознаграждений — задача принципиально сложная. Ключевая часть этой сложности заключается в выборе компромиссов между конкурирующими целями, такими как эффективность выполнения задачи и соблюдение требований безопасности. В Constrained RL нам не нужно выбирать компромиссы — вместо этого мы выбираем желаемые результаты, а алгоритмы сами находят компромиссы, которые приводят нас к нужным результатам.
На примере беспилотного автомобиля можно обрисовать, что это значит на практике. Предположим, автомобиль зарабатывает определенную сумму денег за каждую завершенную поездку и должен платить штраф за каждое столкновение.
В обычном RL вы выбираете штраф за столкновение в начале обучения и оставляете его неизменным навсегда. Проблема здесь в том, что если плата за поездку достаточно высока, агенту может быть всё равно, попадает ли он в многочисленные аварии (до тех пор, пока он все еще может выполнять поездки). На самом деле, может оказаться даже выгоднее ездить безрассудно и рисковать этими столкновениями ради денег. Мы уже наблюдали это ранее при обучении агентов с не ограниченным RL.
В отличие от этого, в Constrained RL вы выбираете допустимую частоту столкновений в начале обучения и корректируете штраф за столкновение до тех пор, пока агент не начнет удовлетворять этому требованию. Если автомобиль слишком часто попадает в мелкие аварии, вы повышаете штраф до тех пор, пока такое поведение перестанет стимулироваться.
Safety Gym
Чтобы изучить Constrained RL для безопасного исследования, мы разработали новый набор сред и инструментов под названием Safety Gym. По сравнению с существующими средами для обучения с ограничениями, среды Safety Gym более богаты и отличаются более широким диапазоном сложности.
Во всех средах Safety Gym робот должен перемещаться по загроможденному пространству для выполнения задачи. Существует три готовых робота (Point, Car и Doggo), три основные задачи (Goal, Button и Push) и два уровня сложности для каждой задачи. Ниже мы приводим обзор комбинаций роботов и задач, но обязательно ознакомьтесь с нашей статьей для получения подробностей.
В этих видео мы показываем, как агент без ограничений пытается решить задачи в этих средах. Каждый раз, когда робот совершает небезопасное действие (в данном случае — врезается в преграды), вокруг агента вспыхивает красный предупреждающий свет, и агент несет издержки (отдельно от вознаграждения за выполнение задачи). Поскольку эти агенты не имеют ограничений, они часто ведут себя небезопасно в попытках максимизировать вознаграждение.
Point — простой робот, ограниченный двумерной плоскостью, с одним приводным механизмом для поворотов и другим для движения вперед или назад. У Point есть небольшой квадрат спереди, который помогает при выполнении задачи Push (Толкание).
Car имеет два независимых параллельных колеса и одно свободно вращающееся заднее колесо. Для этого робота поворот и движение вперед или назад требуют координации обоих приводов.
Doggo — четвероногий робот с двусторонней симметрией. Каждая из его четырех ног имеет по два элемента управления в бедре (для азимута и высоты относительно туловища) и один в колене, управляющий углом. Равномерная случайная политика удерживает робота от падения и обеспечивает передвижение.
Бенчмарк
Чтобы сделать Safety Gym полезным «из коробки», мы оценили ряд стандартных алгоритмов RL и Constrained RL на наборе бенчмарков Safety Gym: PPO, TRPO, версии PPO и TRPO с лагранжевым штрафом, а также Constrained Policy Optimization (CPO).
Наши предварительные результаты демонстрируют широкий диапазон сложности сред Safety Gym: самые простые среды легко поддаются решению и позволяют быстро проводить итерации, в то время как самые сложные могут оказаться непосильными для современных методов. Мы также обнаружили, что методы Лагранжа неожиданно превзошли CPO, опровергнув предыдущий результат в этой области.
Ниже мы показываем кривые обучения для среднего вознаграждения за эпизод и средней суммы издержек за эпизод. В нашей статье мы описываем, как использовать эти и третью метрику (среднюю стоимость за время обучения) для сравнения алгоритмов и измерения прогресса.
Для облегчения воспроизводимости и будущих исследований мы также выпускаем код алгоритмов, который мы использовали для запуска этих экспериментов, в виде репозитория Safety Starter Agents.
Нерешенные проблемы
Предстоит еще многое сделать для доработки алгоритмов Constrained RL и их интеграции с другими условиями задач и методами безопасности. На данный момент нас больше всего интересуют три направления:
- Повышение производительности в текущих средах Safety Gym.
- Использование инструментов Safety Gym для исследования проблем безопасного трансферного обучения и сдвига распределения.
- Объединение Constrained RL с неявными спецификациями (такими как предпочтения людей) для вознаграждений и издержек.
Мы ожидаем, что точно так же, как сегодня мы измеряем точность или производительность систем в определенной задаче, со временем мы будем измерять и «безопасность» систем. Такие показатели вполне могут быть интегрированы в схемы оценки, которые разработчики используют для тестирования своих систем, и потенциально могут применяться правительством для создания стандартов безопасности.
Если вы хотите вместе с нами решать проблемы безопасного исследования, мы нанимаем сотрудников!
Сноски
Авторы
Благодарности
Мы искренне благодарим всех, кто внес свой вклад в этот релиз. Спасибо Кристи Деннисон (Christy Dennison), Итану Найту (Ethan Knight) и Адаму Стуку (Adam Stooke) за обсуждения, исследования и тестирование Safety Gym на всех этапах, а также Мире Мурати (Mira Murati) за поддержку проектной команды. Спасибо Карлу Коббе (Karl Cobbe), Маттиасу Плапперту (Matthias Plappert) и Джейкобу Хилтону (Jacob Hilton) за отзывы о статье. Спасибо Эшли Пилипишин (Ashley Pilipiszyn), Бену Барри (Ben Barry), Джастину Джею Вангу (Justin Jay Wang), Ричарду Пересу (Richard Perez), Джен ДеРосе (Jen DeRosa) и Грегу Брокману (Greg Brockman) за работу над редактированием, дизайном, иллюстрациями и публикацией этого материала. Спасибо Аманде Аскелл (Amanda Askell), Джеку Кларку (Jack Clark) и Майлзу Брандаджу (Miles Brundage) за обсуждения и вклад в запись блога об измерениях безопасности ИИ и политических последствиях. Спасибо Крису Хессе (Chris Hesse) за координацию руководств по выпуску с открытым исходным кодом.
Полный текст статьи читайте на OpenAI
