Сравнительное тестирование безопасного исследования в глубоком обучении с подкреплением

Читать статью
Benchmarking Safe Exploration In Deep Reinforcement Learning

Аннотация

Агентам, использующим обучение с подкреплением (RL), необходимо исследовать свое окружение, чтобы находить оптимальные стратегии методом проб и ошибок. Во многих средах безопасность имеет критически важное значение, а определенные ошибки недопустимы: например, робототехнические системы, взаимодействующие с людьми, никогда не должны наносить им вред в процессе исследования. Хотя в настоящее время принято обучать RL-агентов преимущественно или полностью в симуляторах, где проблемы безопасности минимальны, мы предполагаем, что трудности при имитации сложностей реального мира (таких как взаимодействия между людьми и ИИ) приведут к смещению фокуса в сторону непосредственного обучения RL-агентов в реальном мире, где вопросы безопасности выходят на первый план. Следовательно, мы придерживаемся мнения, что безопасное исследование должно рассматриваться как важнейшая область для исследований в области RL, и в данной работе представляем три вклада в развитие изучения безопасного исследования. Во-первых, опираясь на широкий спектр предшествующих работ по безопасному обучению с подкреплением, мы предлагаем стандартизировать обучение с подкреплением с ограничениями в качестве основного формализма для безопасного исследования. Во-вторых, мы представляем набор тестов Safety Gym — новый пакет высокоразмерных сред непрерывного управления для измерения прогресса исследований в области RL с ограничениями. Наконец, мы проводим сравнительное тестирование нескольких алгоритмов глубокого RL с ограничениями в средах Safety Gym для создания базовых показателей, на которые смогут опираться будущие исследования.

Авторы

Алекс Рэй (Alex Ray), Джошуа Ачиам (Joshua Achiam), Дарио Амодей (Dario Amodei)

Полный текст статьи читайте на OpenAI