Сравнительное тестирование безопасного исследования в глубоком обучении с подкреплением

Аннотация
Агентам, использующим обучение с подкреплением (RL), необходимо исследовать свое окружение, чтобы находить оптимальные стратегии методом проб и ошибок. Во многих средах безопасность имеет критически важное значение, а определенные ошибки недопустимы: например, робототехнические системы, взаимодействующие с людьми, никогда не должны наносить им вред в процессе исследования. Хотя в настоящее время принято обучать RL-агентов преимущественно или полностью в симуляторах, где проблемы безопасности минимальны, мы предполагаем, что трудности при имитации сложностей реального мира (таких как взаимодействия между людьми и ИИ) приведут к смещению фокуса в сторону непосредственного обучения RL-агентов в реальном мире, где вопросы безопасности выходят на первый план. Следовательно, мы придерживаемся мнения, что безопасное исследование должно рассматриваться как важнейшая область для исследований в области RL, и в данной работе представляем три вклада в развитие изучения безопасного исследования. Во-первых, опираясь на широкий спектр предшествующих работ по безопасному обучению с подкреплением, мы предлагаем стандартизировать обучение с подкреплением с ограничениями в качестве основного формализма для безопасного исследования. Во-вторых, мы представляем набор тестов Safety Gym — новый пакет высокоразмерных сред непрерывного управления для измерения прогресса исследований в области RL с ограничениями. Наконец, мы проводим сравнительное тестирование нескольких алгоритмов глубокого RL с ограничениями в средах Safety Gym для создания базовых показателей, на которые смогут опираться будущие исследования.
Авторы
Полный текст статьи читайте на OpenAI
