Эмерджентное использование инструментов в результате взаимодействия множества агентов

Иллюстрация: Бен Барри (Ben Barry)
Мы наблюдали, как агенты открывают для себя все более сложные способы использования инструментов в процессе простой игры в прятки. Проходя обучение в нашей новой симулированной среде для игры в прятки, агенты вырабатывают серию из шести различных стратегий и контрстратегий, о поддержке некоторых из которых нашей средой мы даже не подозревали. Самообучающаяся эмерджентная сложность в этой простой среде говорит о том, что коадаптация множества агентов может однажды привести к появлению чрезвычайно сложного и разумного поведения.
В нашей среде агенты играют в командные прятки. Перед прячущимися (синие) стоит задача избегать попадания в поле зрения ищущих (красные), а перед ищущими — удерживать прячущихся в поле зрения. По всей среде разбросаны объекты, которые агенты могут брать и запирать на месте, а также случайно сгенерированные неподвижные комнаты и стены, в которых агенты должны научиться ориентироваться. Перед началом игры прячущимся дается фаза подготовки, во время которой ищущие обездвиживаются, чтобы у прячущихся была возможность убежать или изменить окружающую обстановку.
У агентов нет явных стимулов взаимодействовать с объектами в среде; единственным руководством служит цель игры в прятки. Агенты получают командную награду: прячущимся начисляется +1, если все они спрятались, и -1, если ищущий заметил хотя бы одного из них. Ищущие получают противоположную награду: -1, если все прячущиеся спрятались, и +1 в противном случае. Чтобы поведение агентов не выходило за разумные рамки, они наказываются за слишком сильное удаление от игровой зоны. Во время фазы подготовки все агенты получают нулевую награду.
Автоучебные программы и эмерджентное поведение
По мере того как агенты соревнуются друг с другом в прятки, возникает до шести различных стратегий. Каждая новая стратегия создает несуществовавшее ранее давление, заставляющее агентов переходить к следующему этапу. Обратите внимание, что у агентов нет прямых стимулов для взаимодействия с объектами или исследования; скорее, показанные ниже эмерджентные стратегии являются результатом автоучебной программы (autocurriculum), вызванной конкуренцией множества агентов и простой динамикой пряток.
Обучение агентов для игры в прятки
Мы используем ту же инфраструктуру обучения и алгоритмы, которые применялись для обучения OpenAI Five и Dactyl. Однако в нашей среде каждый агент действует независимо, используя собственные наблюдения и скрытое состояние памяти. Агенты используют объектно-центрированное представление мира на основе состояний, которое является инвариантным к перестановкам по отношению к объектам и другим агентам.
Каждый объект встраивается, а затем пропускается через блок маскированного остаточного самовнимания, аналогичный тем, что используются в трансформерах, где внимание направлено на объекты, а не во времени. Объекты, которые не находятся в поле зрения и перед агентом, маскируются так, что агент не имеет о них никакой информации.

Политики агентов обучаются с помощью самоигры и оптимизации проксимальной политики (PPO). Во время оптимизации агенты могут использовать привилегированную информацию о скрытых объектах и других агентах в своей функции ценности.
Мы обнаружили, что крупномасштабное обучение имеет решающее значение для прохождения агентами различных этапов эмерджентности. Ниже мы показываем как время, так и количество эпизодов, необходимых агентам для достижения этапа 4 (защита с помощью пандуса) для различных размеров батча. Мы выяснили, что увеличение размера батча дает кардинальное ускорение реального времени сходимости, хотя и не сильно влияет на эффективность использования выборок при значении 32k или выше. Тем не менее, батчи размером 8k и 16k так и не достигли этапа 4 за отведенное количество эпизодов.
Конкуренция множества агентов против внутренней мотивации
В этой работе мы представляем доказательства того, что агенты изучают сложные стратегии и контрстратегии с помощью самоконтролируемой автоучебной программы в игре в прятки. Другим методом приобретения навыков без учителей является внутренняя мотивация (intrinsic motivation), которая стимулирует агентов исследовать пространство с помощью различных метрик, таких как ошибка модели или подсчет посещений состояний. Мы запустили исследование на основе подсчета состояний в нашей среде, в рамках которого агенты ведут явный подсчет посещенных ими состояний и стимулируются переходить в редко посещаемые состояния. Основным выбором модели при настройке в этом сценарии является представление состояний; например, в нашем первом базовом варианте мы включаем в состояние только двумерные координаты коробок, так что агенты стимулируются взаимодействовать с коробками и перемещать их в новые положения. Затем мы сравниваем это с политикой на основе подсчета, которая использует полное состояние, предоставляемое агентам, играющим в прятки.
Как видно, агенты, обученные игре в прятки, качественно ориентируются на гораздо более понятное для человека поведение, такое как строительство укрытий, в то время как агенты, обученные с помощью внутренней мотивации, перемещают объекты хаотичным образом. Более того, по мере усложнения пространства состояний мы обнаруживаем, что методы внутренней мотивации демонстрируют все менее и менее осмысленные взаимодействия с объектами в своей среде. По этой причине мы считаем, что конкуренция множества агентов станет более масштабируемым методом генерации полезных для человека навыков в условиях отсутствия учителей по мере того, как размеры и сложность сред будут продолжать расти.
Перенос навыков и тонкая настройка как метод оценки
В предыдущем разделе мы провели качественное сравнение поведения, усвоенного в прятках, с поведением, приобретенным с помощью внутренней мотивации. Однако по мере роста масштаба сред будет расти и сложность качественного измерения прогресса. Отслеживание наград является недостаточной метрикой оценки в условиях множества агентов, так как оно может быть двусмысленным в отношении того, улучшаются ли агенты равномерно или они застряли на месте. Такие метрики, как Эло или TrueSkill, могут более надежно оценивать, улучшается ли производительность по сравнению с предыдущими версиями политик или другими политиками в популяции; тем не менее, эти метрики по-прежнему не дают представления о том, вызвано ли улучшение производительности новыми адаптациями или совершенствованием ранее усвоенных навыков. Наконец, использование специфичной для среды статистики, такой как перемещение объектов, также может быть неоднозначным (например, выбор отслеживания абсолютного перемещения не проясняет, в каком направлении двигались агенты), и разработка достаточных метрик станет сложной и дорогостоящей задачей по мере масштабирования сред.
Мы предлагаем использовать набор специфичных для домена тестов интеллекта, которые нацелены на возможности, которые агенты, по нашему мнению, могут со временем приобрести. Эффективность переноса в этих условиях может служить количественной мерой качества представлений или навыков, и мы проводим сравнение с предварительным обучением с исследованием на основе подсчета, а также с базовым вариантом, обученным с нуля.
Хотя агент, играющий в прятки, показывает лучшие результаты во многих задачах на перенос, это не приводит к кардинальному улучшению производительности или времени сходимости. Наблюдая за его поведением, мы знаем, что у него есть скрытый навык точно перемещать объекты для построения укрытия в игре в прятки; однако он не обладает способностью использовать этот навык в других контекстах при обучении на небольшом количестве выборок.
Мы полагаем, что причина неоднозначных результатов переноса кроется в том, что агенты изучают запутанные и трудно поддающиеся тонкой настройке представления навыков. По мере того как будущие среды будут становиться все более разнообразными, а агенты должны будут использовать навыки в большем числе контекстов, мы рассчитываем увидеть более обобщаемые представления навыков и более значимый сигнал в таком подходе к оценке. Кроме того, мы открываем исходный код задач оценки в качестве инструмента для отслеживания прогресса обучения в нашей среде.
Удивительное поведение
Мы показали, что агенты могут освоить сложные инструменты в высокоточном физическом симуляторе; однако на пути к этому результату было извлечено множество уроков. Создание сред — непростая задача, и довольно часто агенты находят способ непредвиденным образом использовать созданную вами среду или физический движок.
Авторы
Отзывы и комментарии
Спасибо следующим лицам за отзывы об этой статье и исследовании: Питер Аббил (Pieter Abbeel), Джефф Клун (Jeff Clune), Джессика Хамрик (Jessica Hamrick), Джоэл Лейбо (Joel Leibo), Наташа Жаке (Natasha Jaques), Калвин Френч-Оуэн (Calvin French-Owen), Азалия Мирхосейни (Azalia Mirhoseini), Илья Суцкевер (Ilya Sutskever), Грег Брокман (Greg Brockman), Джек Кларк (Jack Clark), Брук Чан (Brooke Chan) и Карсон Эльмгрен (Karson Elmgren)
Прочее
Видео: Гленн Пауэлл (Glenn Powell), Лео Огава Лиллранк (Leo Ogawa Lillrank), Айви Лиллранк (Ivy Lillrank), Энди Ли (Andie Lee)
Редактор: Эшли Пилипишин (Ashley Pilipiszyn)
Дизайн: Джастин Джей Ванг (Justin Jay Wang)
Иллюстрация на обложке: Бен Барри (Ben Barry)
Полный текст статьи читайте на OpenAI
