Конкретные проблемы безопасности ИИ

Мы (совместно с исследователями из Беркли и Стэнфорда) являемся соавторами опубликованной сегодня статьи под руководством исследователей из Google Brain, «Конкретные проблемы безопасности ИИ». В статье рассматриваются многочисленные исследовательские задачи, связанные с обеспечением того, чтобы современные системы машинного обучения функционировали должным образом.
Мы (совместно с исследователями из Беркли и Стэнфорда) являемся соавторами опубликованной сегодня статьи под руководством исследователей из Google Brain, «Конкретные проблемы безопасности ИИ». В статье рассматриваются многочисленные исследовательские задачи, связанные с обеспечением того, чтобы современные системы машинного обучения функционировали должным образом. (Проблемы носят весьма практический характер, и некоторые из них уже внедряются в OpenAI Gym.)
Развитие искусственного интеллекта требует не только повышения интеллектуальности систем ИИ, но и предотвращения аварий — то есть обеспечения того, чтобы системы ИИ делали именно то, чего действительно хотят люди. Исследовательское сообщество уделяет всё больше внимания вопросам безопасности, примером чему служит недавняя статья от DeepMind и FHI. Тем не менее, многие исследователи в области машинного обучения задаются вопросом, насколько масштабные исследования безопасности можно провести уже сегодня.
Авторы обсуждают пять областей:
- Безопасное исследование среды. Могут лиагенты обучения с подкреплением(RL) изучать свое окружение без совершения катастрофических действий? Например, может ли RL-агент научиться ориентироваться в пространстве, ни разу не сорвавшись с обрыва?
- Устойчивость к изменению распределения данных. Могут ли системы машинного обучения быть устойчивыми к изменениям в распределении данных или, по крайней мере, корректно завершать работу при сбоях? Например, можем ли мы создавать классификаторы изображений, которые демонстрируют должную неуверенность при демонстрации новых типов изображений, вместо того чтобы самоуверенно пытаться применить потенциально неприменимую обученную модель?
- Предотвращение нежелательных побочных эффектов. Можно ли модифицироватьфункцию вознагражденияRL-агента так, чтобы избежать нежелательного влияния на окружающую среду? Например, можем ли мы создать робота, который будет перемещать предмет, избегая опрокидывания или поломки чего-либо вокруг, без необходимости вручную программировать отдельный штраф для каждого возможного некорректного поведения?
- Предотвращение «взлома системы вознаграждения» (reward hacking) и »фиксации на источнике награды» (wireheading). Можем ли мы помешать агентам «манипулировать» своими функциями вознаграждения, например путем искажения собственных наблюдений? Например, можем ли мы обучить RL-агента минимизировать количество грязных поверхностей в здании так, чтобы он не начал избегать поиска грязи или специально создавать новые загрязнения для последующей уборки?
- Масштабируемый контроль (scalable oversight). Могут ли RL-агенты эффективно достигать целей, обратная связь по которым стоит очень дорого? Например, можем ли мы создать агента, который пытается убрать комнату именно так, как больше всего понравилось бы пользователю, несмотря на то, что отзывы пользователя поступают крайне редко, и во время обучения приходится использовать дешевые приближения (вроде наличия видимой грязи)? Расхождение между дешевыми приближениями и тем, что заботит нас на самом деле, является важным источником риска аварий.
Многие из этих проблем не новы, но в статье они рассматриваются в контексте передовых систем. Мы надеемся, что это вдохновит еще больше людей на работу над проблемами безопасности ИИ — будь то в OpenAI или в другом месте.
Нам особенно приятно участвовать в создании этой статьи в рамках межведомственного сотрудничества. Мы верим, что широкая кооперация в области безопасности ИИ позволит каждому создавать более совершенные системы машинного обучения. Дайте нам знать, если у вас есть материал для будущей совместной публикации!
Авторы
Полный текст статьи читайте на OpenAI
