#Исследование: Изучение методов исследования на основе подсчета для глубокого обучения с подкреплением

Читать статью
Exploration A Study Of Count Based Exploration For Deep Reinforcement Learning

Аннотация

Алгоритмы исследования на основе подсчета демонстрируют близкую к оптимальной производительность при использовании в сочетании с табулярными методами обучения с подкреплением (RL) для решения задач с небольшими дискретными марковскими процессами принятия решений (MDP). Общепринято считать, что методы на основе подсчета не могут применяться в пространствах состояний высокой размерности, поскольку большинство состояний встречаются только один раз. Современные стратегии исследования с помощью глубокого обучения с подкреплением способны справляться с многомерными непрерывными пространствами состояний с помощью сложных эвристик, часто полагаясь на оптимизм перед лицом неопределенности или внутреннюю мотивацию. В данной работе мы описываем неожиданное открытие: простое обобщение классического подхода на основе подсчета позволяет достичь производительности, близкой к современному уровню (state-of-the-art), на различных многомерных и/или непрерывных бенчмарках глубокого обучения с подкреплением. Состояния отображаются в хэш-коды, что позволяет подсчитывать их появления с помощью хэш-таблицы. Эти значения подсчета затем используются для вычисления бонусного вознаграждения в соответствии с классической теорией исследования на основе подсчета. Мы обнаруживаем, что простые хэш-функции могут давать удивительно хорошие результаты в решении множества сложных задач. Более того, мы показываем, что зависящий от предметной области обученный хэш-код может еще больше улучшить эти результаты. Подробный анализ выявляет важные аспекты хорошей хэш-функции: 1) наличие соответствующей гранулярности и 2) кодирование информации, имеющей отношение к решению MDP. Данная стратегия исследования достигает производительности, близкой к передовой, как в задачах непрерывного управления, так и в играх Atari 2600, обеспечивая тем самым простую, но мощную базовую линию для решения MDP, требующих значительного исследования.

Авторы

Хоран Тан, Рейн Хаутхуфт, Дэвис Фут, Адам Стук, Си Чэнь, Ян Дуань, Джон Шульман, Филип Де Тюрк, Питер Аббел

Полный текст статьи читайте на OpenAI