Эволюционные градиенты политик

Читать статьюПосмотреть код
Evolved Policy Gradients

Мы выпускаем экспериментальный подход к метаобучению под названием Evolved Policy Gradients (EPG). Это метод эволюции функции потерь обучаемых агентов, который обеспечивает быстрое обучение при решении новых задач. Агенты, обученные с помощью EPG, способны успешно справляться на этапе тестирования с базовыми задачами, выходящими за рамки их обучающей выборки — например, находить объект на другой стороне комнаты, отличной от места его размещения во время обучения.

EPG обучает агентов формировать предварительное представление о том, что считается прогрессом в новой задаче. Вместо того чтобы кодировать априорные знания с помощью обученной сети политики, EPG кодирует их в виде обученной функциипотерь. Затем агенты могут использовать эту функцию потерь, определенную как темпорально-сверточная нейронная сеть, для быстрого обучения на новой задаче. Мы показали, что EPG способна обобщать знания для тестовых задач, находящихся вне распределения (out of distribution), демонстрируя поведение, качественно отличающееся от других популярных алгоритмов метаобучения. В ходе тестов мы также обнаружили, что EPG способна обучать агентов быстрее, чем PPO — готовый метод градиента политики. EPG связана с предыдущими работами по эволюциифункцийнаграддля агентов с подкреплением, но обобщает эту идею на эволюцию полной функции потерь, что означает, что функция потерь должна эффективно изучать алгоритм обучения с подкреплением изнутри.

Интуиция, лежащая в основе EPG, знакома каждому из нас: когда мы пытаемся освоить новый навык, мы испытываем смесь разочарования и радости, сопровождающую этот процесс. Допустим, вы только начинаете учиться играть на скрипке. Даже без инструкций вы сразу почувствуете, что следует попробовать, а прислушиваясь к издаваемым звукам, поймете, продвигаетесь ли вы вперед. Это происходит потому, что у вас фактически есть доступ к очень хорошо сформированным внутренним функциям вознаграждения, полученным из предшествующего опыта выполнения других моторных задач и в ходе биологической эволюции. В отличие от этого, большинство агентов обучения с подкреплением (RL) подходят к каждой новой задаче без использования предварительных знаний. Вместо этого они полностью полагаются на внешние сигналы вознаграждения, направляющие их первоначальное поведение. Неудивительно, что при таком «чистом листе» современные агенты обучения с подкреплением осваивают простые навыки намного дольше, чем люди. EPG делает шаг в сторону агентов, которые не являются чистым листом, а знают, что значит продвигаться в решении новой задачи, благодаря опыту достижения прогресса в аналогичных задачах в прошлом.

Flow diagram

EPG состоит из двух циклов оптимизации. Во внутреннем цикле агент с нуля учится решать конкретную задачу, выбранную из семейства задач. Семейством задач может быть «переместить захват целевого устройства в целевое положение [x, y]», а конкретной задачей в этом семействе — «переместить захват в положение [50, 100]». Во внутреннем цикле используется стохастический градиентный спуск (SGD) для оптимизации политики агента относительно функции потерь, предложенной внешним циклом. Внешний цикл оценивает показатели эффективности, достигнутые после обучения во внутреннем цикле, и корректирует параметры функции потерь с помощью эволюционных стратегий (ES), чтобы предложить новую функцию потерь, которая обеспечит более высокие результаты.

Использование обученной функции потерь дает несколько преимуществ по сравнению с текущими методами обучения с подкреплением: применение ES для эволюции функции потерь позволяет нам оптимизировать истинную целевую функцию (производительность финальной обученной политики), а не краткосрочные награды, при этом EPG совершенствует стандартные алгоритмы RL, позволяя функции потерь адаптироваться к среде и предыстории агента.

В последнее время наблюдается волна работпометаобучениюполитик, и стоит задаться вопросом: зачем изучать функцию потерь, а не напрямую политику? Обучение рекуррентных политик имеет тенденцию к переобучению под конкретную задачу, в то время как обучение инициализаций политик обладает ограниченной выразительностью в отношении исследования среды. Наша мотивация заключается в том, что мы ожидаем от функций потерь способности очень хорошо обобщаться на существенно отличающиеся задачи. Это безусловно справедливо для вручную спроектированных функций потерь: хорошо продуманная функция потерь в RL, например, в PPO, может быть универсально применима и находить применение в задачах от игры в Atari до управления роботами.

Чтобы проверить способность EPG к обобщению, мы провели простой эксперимент. Мы настроили функцию потерь EPG так, чтобы она эффективно заставляла «муравьев» ходить к случайно расположенным целям в правой половине арены. Затем мы зафиксировали функцию потерь и дали муравьям новую цель — на этот раз в левой половине арены. Удивительно, но муравьи научились ходить налево! Вот как выглядели их кривые обучения (красные линии на графиках):

Learning curves

Этот результат вызывает у нас энтузиазм, поскольку он демонстрирует обобщение на задачу вне обучающего распределения. Добиться такого рода обобщения бывает довольно сложно. Мы сравнили EPG с альтернативным алгоритмом метаобучения под названием RL2, который пытается напрямую обучить политику, способную адаптироваться к новым задачам. В нашем эксперименте RL2 действительно успешно заставил агентов ходить к целям на правой половине экрана. Однако при появлении тестовой цели на левой половине экрана он потерпел качественную неудачу и просто продолжил идти направо. В некотором смысле он «переобучился» на наборе задач, на которых тренировался (то есть на ходьбе вправо).

Как и все подходы метаобучения, наш метод по-прежнему имеет множество ограничений. Прямо сейчас мы можем обучать потерю EPG так, чтобы она была эффективна только для одного небольшого семейства задач за раз — например, заставлять муравья ходить налево и направо. Тем не менее, функция потерь EPG для этого семейства задач вряд ли будет хоть сколько-нибудь эффективна для совершенно другого типа задач, например, для игры в Space Invaders. В отличие от этого, стандартные потери RL обладают таким уровнем универсальности — одна и та же функция потерь может использоваться для изучения огромного разнообразия навыков. EPG выигрывает в производительности, проигрывая в универсальности. Впереди долгий путь к методам метаобучения, которые одновременно превосходят стандартные методы RL и обладают таким же уровнем универсальности.

Авторы

Rein Houthooft, Richard Chen, Phillip Isola, Bradly Stadie, Filip Wolski, Jonathan Ho, Pieter Abbeel

Полный текст статьи читайте на OpenAI