Учимся моделировать чужой разум

Мы выпускаем алгоритм, который учитывает то факты, что другие агенты тоже учатся, и находит эгоистичные, но при этом совместные стратегии вроде «око за око» в итеративной дилемме заключенного. Этот алгоритм, названный LOLA (Learning with Opponent-Learning Awareness — обучение с учетом обучения противника), представляет собой небольшой шаг на пути к созданию агентов, способных моделировать чужой разум.
LOLA — результат совместной работы исследователей из OpenAI и Оксфордского университета. Этот алгоритм позволяет агенту с подкреплением (RL) учитывать обучение других при обновлении собственной стратегии. Каждый агент LOLA корректирует свою политику так, чтобы направлять обучение других агентов выгодным для себя образом. Это возможно потому, что обучение других агентов зависит от наград и наблюдений в среде, на которые, в свою очередь, может влиять данный агент.
Это означает, что агент LOLA («Алиса») моделирует то, как обновление параметров другого агента («Боба») зависит от ее собственной политики и как обновление параметров Боба влияет на ее собственную будущую ожидаемую награду. Затем Алиса обновляет свою политику так, чтобы шаг обучения других агентов (таких как Боб) приносил больше пользы ее собственным целям.
Агенты LOLA могут находить эффективные взаимные стратегии в таких играх, как итеративная дилемма заключенного или игра с монетками. В то же время передовые методы глубокого обучения с подкреплением (например, Independent PPO) в таких условиях не способны выучить подобные стратегии. Такие агенты обычно учатся совершать эгоистичные действия, игнорируя цели других агентов. LOLA решает эту проблему, позволяя агентам действовать из соображений личной выгоды, которая включает в себя цели других. Кроме того, алгоритм работает без необходимости использования созданных вручную правил или специально настроенных для поощрения сотрудничества сред.
Вдохновением для LOLA послужило то, как люди сотрудничают друг с другом: люди прекрасно умеют рассуждать о том, как их действия могут повлиять на будущее поведение других людей, и часто изобретают способы сотрудничества, приводящие к результату «выигрыш-выигрыш». Одна из причин, почему люди хорошо сотрудничают, заключается в наличии у них «теории разума» в отношении других людей, что позволяет им разрабатывать стратегии, приносящие пользу их партнерам. До сих пор подобное представление «теории разума» отсутствовало в глубоком многоагентном обучении с подкреплением. Для передового агента глубокого RL нет принципиальной разницы между другим обучающимся агентом и частью окружающей среды — например, деревом.
Ключом к эффективности LOLA является включение члена:
Здесь левая часть отражает то, как доход Алисы зависит от изменения политики Боба. Правая часть описывает, как шаг обучения Боба зависит от политики Алисы. Перемножение этих двух компонентов по сути измеряет то, как Алиса может изменить шаг обучения Боба так, чтобы это привело к увеличению ее собственных наград.
Это означает, что при обучении наши агенты пытаются оптимизировать свой доход после одного предполагаемого шага обучения противника. Дифференцируя этот ожидаемый шаг обучения, агент может активно формировать обновление параметров оппонента так, чтобы увеличить собственный доход.
Хотя приведенная выше формула предполагает доступ к истинному градиенту и гессиану двух функций ценности, мы также можем оценивать все необходимые слагаемые с помощью выборки. В частности, слагаемое второго порядка можно оценить с помощью теоремы о градиенте политики, что делает LOLA подходящей для любых задач глубокого обучения с подкреплением.
LOLA справляется с этим, включая этап моделирования противника, на котором мы подгоняем модель оппонента под наблюдаемые траектории, прогнозируя параметры других агентов на основе их действий. В будущем мы хотели бы расширить этот подход, также выводя архитектуры и награды из наблюдаемого процесса обучения.

LOLA работает как в ситуациях, когда у нас есть доступ к политике других агентов (LOLA), так и в тех случаях, когда мы можем оценивать состояние других агентов только по следам (LOLA-OM). Оба подхода собирают больше монет (слева) и набирают гораздо больше очков (справа), чем другие подходы.
Результаты
LOLA позволяет нам обучать агентов, которые успешно справляются с игрой с монетками, где два агента, красный и синий, соревнуются друг с другом в сборе монет красного и синего цветов. Каждый агент получает очко за сбор любой монетки, но если они подбирают монетку не своего цвета, другой агент получает штраф –2. Таким образом, если оба агента жадно подбирают обе монеты, в среднем каждый получает ноль очков. Агенты LOLA учатся преимущественно собирать монеты своего цвета, что приводит к высоким результатам (показано выше).
Недостатки
LOLA работает лучше всего при использовании батчей большого размера и полных траекторий для снижения дисперсии. Это означает, что метод требует больших затрат памяти и вычислительной мощности. Кроме того, при моделировании противника LOLA может демонстрировать нестабильность, которую мы надеемся устранить в будущих доработках.
Авторы
Полный текст статьи читайте на OpenAI
