#Исследование: Изучение методов исследования на основе подсчета для глубокого обучения с подкреплением

Аннотация
Алгоритмы исследования на основе подсчета демонстрируют близкую к оптимальной производительность при использовании в сочетании с табулярными методами обучения с подкреплением (RL) для решения задач с небольшими дискретными марковскими процессами принятия решений (MDP). Общепринято считать, что методы на основе подсчета не могут применяться в пространствах состояний высокой размерности, поскольку большинство состояний встречаются только один раз. Современные стратегии исследования с помощью глубокого обучения с подкреплением способны справляться с многомерными непрерывными пространствами состояний с помощью сложных эвристик, часто полагаясь на оптимизм перед лицом неопределенности или внутреннюю мотивацию. В данной работе мы описываем неожиданное открытие: простое обобщение классического подхода на основе подсчета позволяет достичь производительности, близкой к современному уровню (state-of-the-art), на различных многомерных и/или непрерывных бенчмарках глубокого обучения с подкреплением. Состояния отображаются в хэш-коды, что позволяет подсчитывать их появления с помощью хэш-таблицы. Эти значения подсчета затем используются для вычисления бонусного вознаграждения в соответствии с классической теорией исследования на основе подсчета. Мы обнаруживаем, что простые хэш-функции могут давать удивительно хорошие результаты в решении множества сложных задач. Более того, мы показываем, что зависящий от предметной области обученный хэш-код может еще больше улучшить эти результаты. Подробный анализ выявляет важные аспекты хорошей хэш-функции: 1) наличие соответствующей гранулярности и 2) кодирование информации, имеющей отношение к решению MDP. Данная стратегия исследования достигает производительности, близкой к передовой, как в задачах непрерывного управления, так и в играх Atari 2600, обеспечивая тем самым простую, но мощную базовую линию для решения MDP, требующих значительного исследования.
Авторы
Полный текст статьи читайте на OpenAI
