Исследование с помощью верхней доверительной границы (UCB) на основе ансамблей Q-функций
Читать статью

Аннотация
Мы показываем, как ансамбль Q*-функций можно использовать для более эффективного исследования в глубоком обучении с подкреплением. Мы опираемся на хорошо зарекомендовавшие себя алгоритмы для задачи многоруких бандитов и адаптируем их к условиям Q-обучения. Мы предлагаем стратегию исследования, основанную на верхних доверительных границах (UCB). Наши эксперименты демонстрируют значительный прирост производительности на бенчмарке Atari.
Авторы
Ричард Чен (Richard Chen), Шимон Сидор (Symon Sidor), Питер Аббел (Pieter Abbeel), Джон Шульман (John Schulman)
Полный текст статьи читайте на OpenAI
