Учимся сотрудничать, соперничать и общаться

Многоагентные среды, в которых агенты борются за ресурсы, являются важным этапом на пути к искусственному интеллекту общего назначения (AGI). Многоагентные среды обладают двумя полезными свойствами: во-первых, здесь присутствует естественная учебная программа — сложность среды определяется навыками ваших конкурентов (а если вы соревнуетесь со своими клонами, среда точно соответствует вашему уровню навыков). Во-вторых, в многоагентной среде отсутствует стабильное равновесие: какими бы умными ни были агенты, всегда сохраняется стимул становиться умнее. Такие среды сильно отличаются от традиционных, и потребуется еще немало исследований, прежде чем мы научимся хорошо с ними работать.
Мы разработали новый алгоритм MADDPG, предназначенный для централизованного обучения и децентрализованного выполнения в многоагентных средах, который позволяет агентам учиться сотрудничать и конкурировать друг с другом.

MADDPG используется для обучения четырех красных агентов преследованию двух зеленых. Красные агенты научились объединяться в команды для преследования одного зеленого агента, получая за это более высокую награду. Зеленые агенты тем временем научились разделяться: пока одного преследуют, другой пытается добраться до воды (синий круг), избегая красных агентов.
Алгоритм MADDPG расширяет алгоритм обучения с подкреплением под названием DDPG, черпая вдохновение из методов обучения с подкреплением на основе актора и критика (actor-critic); другие группы исследуютвариации и параллельные реализации этих идей.
Мы рассматриваем каждого агента в нашей симуляции как «актора», и каждый актор получает советы от «критика», который помогает актору решать, какие действия подкреплять в процессе обучения. Традиционно критик пытается предсказать ценность (т. е. награду, которую мы ожидаем получить в будущем) действия в определенном состоянии, которая используется агентом — актором — для обновления своей стратегии. Это стабильнее, чем напрямую использовать награду, которая может существенно варьироваться. Чтобы сделать возможным обучение нескольких агентов, способных действовать согласованно на глобальном уровне, мы усовершенствовали наших критиков так, чтобы они имели доступ к наблюдениям и действиям всех агентов, как показано на следующей схеме.

Нашим агентам не нужно обращаться к центральному критику во время тестирования; они действуют на основе собственных наблюдений в сочетании с прогнозами поведения других агентов. Поскольку централизованный критик обучается независимо для каждого агента, наш подход также может использоваться для моделирования произвольных структур наград между агентами, включая состязательные случаи, когда награды противоположны.
Мы протестировали наш подход на различных задачах, и во всех из них он показал себя лучше, чем DDPG. В приведенных выше анимациях слева направо можно увидеть: двух ИИ-агентов, пытающихся добраться до определенного места и научившихся разделяться, чтобы скрыть свое предполагаемое местоположение от агента-соперника; одного агента, сообщающего название ориентира другому агенту;, а также трех агентов, координирующих свои действия для перемещения к ориентирам без столкновений друг с другом.
С какими трудностями сталкивается традиционное обучение с подкреплением
Традиционные децентрализованные подходы обучения с подкреплением — DDPG, actor-critic, глубокое Q-обучение и т. д. — испытывают трудности с обучением в многоагентных средах, поскольку на каждом временном шаге каждый агент пытается научиться предсказывать действия других агентов, одновременно выполняя собственные действия. Это особенно актуально в соревновательных ситуациях. MADDPG использует централизованного критика, чтобы предоставлять агентам информацию о наблюдениях и потенциальных действиях их соратников, превращая непредсказуемую среду в предсказуемую.
Использование методов градиента политики создает дополнительные проблемы: из-за их высокой дисперсии обучение правильной политике становится сложным при непостоянной награде. Мы также обнаружили, что добавление критика, хотя и повышает стабильность, все же не помогло решить задачи в некоторых наших средах, например при кооперативном общении. Похоже, что учет действий других во время обучения имеет решающее значение для освоения стратегий сотрудничества.
Первые исследования
До разработки MADDPG, при использовании децентрализованных методов, мы замечали, что агенты-слушатели часто научались игнорировать говорящего, если тот отправлял противоречивые сообщения о том, куда идти. Затем агент устанавливал все веса, связанные с сообщениями говорящего, равными 0, фактически «оглушая» себя. Как только это происходит, обучению трудно восстановиться, поскольку говорящий никогда не узнает, говорит ли он правильные вещи из-за отсутствия какой-либо обратной связи. Чтобы исправить это, мы обратились к методу, описанному в недавнем проекте по иерархическому обучению, который позволяет нам заставить слушателя учитывать высказывания говорящего в процессе принятия решений. Это исправление не сработало, потому что, хотя оно и заставляет слушателя обращать внимание на говорящего, оно не помогает говорящему понять, что именно сказать, чтобы это было уместно. Наш метод централизованного критика помогает справиться с этими трудностями, помогая говорящему узнать, какие высказывания могут иметь отношение к действиям других агентов. С другими нашими результатами вы можете ознакомиться в следующем видео:
Следующие шаги
Моделирование агентов имеет богатую историю в исследованиях искусственного интеллекта, и многие из этих сценариев изучались ранее. Во многих предыдущих исследованиях рассматривались игры лишь с небольшим числом временных шагов и небольшим пространством состояний. Глубокое обучение позволяет нам работать со сложными визуальными входными данными, а обучение с подкреплением дает инструменты для изучения поведения на больших временных отрезках. Теперь, когда мы можем использовать эти возможности для одновременного обучения нескольких агентов без необходимости знания ими динамики среды (того, как среда меняется на каждом временном шаге), мы можем решать более широкий круг задач, связанных с коммуникацией и языком, обучаясь на основе высокоразмерной информации из сред. Если вам интересно исследовать различные подходы к развитию агентов, подумайте о том, чтобы присоединиться к OpenAI.
Авторы
Полный текст статьи читайте на OpenAI
