Обучение с учетом обучения противников

Аннотация
Многоагентные задачи быстро приобретают важное значение в машинном обучении. Сюда относится множество недавних работ по глубокому многоагентному обучению с подкреплением, а также их можно распространить на иерархическое обучение с подкреплением, генеративно-состязательные сети и децентрализованную оптимизацию. Во всех этих условиях присутствие нескольких обучающихся агентов делает задачу обучения нестационарной и часто приводит к нестабильности обучения или нежелательным конечным результатам. Мы представляем метод «Обучение с учетом обучения противников» (LOLA, Learning with Opponent-Learning Awareness), в котором каждый агент формирует предполагаемое обучение других агентов в среде. Правило обучения LOLA включает член, учитывающий влияние стратегии одного агента на ожидаемое обновление параметров других агентов. Результаты показывают, что встреча двух агентов LOLA приводит к появлению стратегии «око за око» и, следовательно, к сотрудничеству в итеративной дилемме заключенного, в то время как независимое обучение к этому не приводит. В этой предметной области LOLA также получает более высокие выплаты по сравнению с наивным обучающимся агентом и устойчива к эксплуатации со стороны методов на основе градиентов более высокого порядка. При применении к повторяющейся игре «орка и решка» (matching pennies) агенты LOLA сходятся к равновесию Нэша. В круговом турнире мы показываем, что агенты LOLA успешно формируют обучение ряда алгоритмов многоагентного обучения из литературы, что приводит к наивысшим средним возвратам в итеративной дилемме заключенного (IPD). Мы также показываем, что правило обновления LOLA может быть эффективно вычислено с использованием расширения оценщика градиента стратегии, что делает этот метод подходящим для обучения с подкреплением без модели. Таким образом, метод масштабируется до больших пространств параметров и входных данных, а также до нелинейных аппроксиматоров функций. Мы применяем LOLA к задаче в сеточной среде (grid world) с внедренной социальной дилеммой, используя рекуррентные стратегии и моделирование противников. Явно учитывая обучение другого агента, агенты LOLA учатся сотрудничать из соображений собственной выгоды. Код доступен по этой ссылке.
Авторы
Полный текст статьи читайте на OpenAI
