Стохастические нейронные сети для иерархического обучения с подкреплением

Аннотация
За последние годы глубокое обучение с подкреплением добилось множества впечатляющих результатов. Тем не менее, задачи с редкими вознаграждениями или большой временной перспективой (долгосрочным горизонтом планирования) по-прежнему представляют собой серьезные трудности. Для решения этих важных проблем мы предлагаем общий фреймворк, который сначала обучает полезным навыкам в среде предварительного обучения, а затем задействует приобретенные навыки для более быстрого обучения в последующих задачах. Наш подход объединяет в себе некоторые сильные стороны внутренней мотивации и иерархических методов: обучение полезным навыкам направляется единым суррогатным вознаграждением, проектирование которого требует минимальных предметных знаний о последующих задачах. Затем поверх этих навыков обучается высокоуровневая стратегия, что обеспечивает значительное улучшение исследования пространства состояний и позволяет справляться с редкими вознаграждениями в последующих задачах. Чтобы эффективно предварительно обучить широкий спектр навыков, мы используем стохастические нейронные сети в сочетании с информационно-теоретическим регуляризатором. Наши эксперименты показывают, что эта комбинация эффективна для изучения широкого спектра интерпретируемых навыков с высокой эффективностью использования выборок и способна существенно повысить производительность обучения во всем спектре последующих задач.
Авторы
Полный текст статьи читайте на OpenAI
