Обучение с учетом обучения противников

Читать статью
Learning With Opponent Learning Awareness

Аннотация

Многоагентные задачи быстро приобретают важное значение в машинном обучении. Сюда относится множество недавних работ по глубокому многоагентному обучению с подкреплением, а также их можно распространить на иерархическое обучение с подкреплением, генеративно-состязательные сети и децентрализованную оптимизацию. Во всех этих условиях присутствие нескольких обучающихся агентов делает задачу обучения нестационарной и часто приводит к нестабильности обучения или нежелательным конечным результатам. Мы представляем метод «Обучение с учетом обучения противников» (LOLA, Learning with Opponent-Learning Awareness), в котором каждый агент формирует предполагаемое обучение других агентов в среде. Правило обучения LOLA включает член, учитывающий влияние стратегии одного агента на ожидаемое обновление параметров других агентов. Результаты показывают, что встреча двух агентов LOLA приводит к появлению стратегии «око за око» и, следовательно, к сотрудничеству в итеративной дилемме заключенного, в то время как независимое обучение к этому не приводит. В этой предметной области LOLA также получает более высокие выплаты по сравнению с наивным обучающимся агентом и устойчива к эксплуатации со стороны методов на основе градиентов более высокого порядка. При применении к повторяющейся игре «орка и решка» (matching pennies) агенты LOLA сходятся к равновесию Нэша. В круговом турнире мы показываем, что агенты LOLA успешно формируют обучение ряда алгоритмов многоагентного обучения из литературы, что приводит к наивысшим средним возвратам в итеративной дилемме заключенного (IPD). Мы также показываем, что правило обновления LOLA может быть эффективно вычислено с использованием расширения оценщика градиента стратегии, что делает этот метод подходящим для обучения с подкреплением без модели. Таким образом, метод масштабируется до больших пространств параметров и входных данных, а также до нелинейных аппроксиматоров функций. Мы применяем LOLA к задаче в сеточной среде (grid world) с внедренной социальной дилеммой, используя рекуррентные стратегии и моделирование противников. Явно учитывая обучение другого агента, агенты LOLA учатся сотрудничать из соображений собственной выгоды. Код доступен по этой ссылке.

Авторы

Якоб Ферстер (Jakob Foerster), Ричард Чен (Richard Chen), Маруан Аль-Шедиват (Maruan Al-Shedivat), Шимон Уайтсон (Shimon Whiteson), Питер Аббил (Pieter Abbeel), Игорь Мордач (Igor Mordatch)

Полный текст статьи читайте на OpenAI