Для обеспечения безопасности ИИ необходимы специалисты в области социальных наук

Читать статью
AI Safety Needs Social Scientists

Мы написали научную работу, в которой утверждаем, что для долгосрочных исследований по безопасности искусственного интеллекта необходимы специалисты в области социальных наук, чтобы алгоритмы выравнивания ИИ успешно работали с реальными людьми. Согласование передовых систем ИИ с человеческими ценностями требует разрешения множества неопределенностей, связанных с психологией человеческой рациональности, эмоций и предвзятости. Цель этой работы — стимулировать дальнейшее сотрудничество между исследователями в области машинного обучения и социальных наук, и мы планируем нанимать социологов для работы над этой задачей на полный рабочий день в OpenAI.

Цель долгосрочной безопасности искусственного интеллекта (ИИ) состоит в том, чтобы гарантировать, что передовые системы ИИ согласованы с человеческими ценностями — то есть они надежно выполняют то, чего от них хотят люди. В OpenAI мы надеемся достичь этого, задавая людям вопросы об их пожеланиях, обучая на этих данных модели машинного обучения (МО) и оптимизируя системы ИИ так, чтобы они успешно работали в соответствии с этими выученными моделями. Примеры таких исследований включают обучение на основе человеческих предпочтений,  обеспечение безопасности ИИ через дебаты и обучение сложным целям с помощью итеративного усиления.

К сожалению, ответы людей на вопросы об их ценностях могут быть ненадежными. У людей ограничены знания и способность к рассуждению, они демонстрируют различные когнитивные искажения и этические убеждения, которые при размышлении оказываются несогласованными. Мы предполагаем, что различные способы постановки вопросов будут по-разному взаимодействовать с человеческими предвзятостями, давая более высокие или более низкие результаты. Например, оценки того, насколько предосудителен тот или иной поступок, могут различаться в зависимости от того, появляется ли в вопросе слово «морально», а люди могут делать противоречивый выбор между рисками, если представленная им задача является сложной.

У нас есть несколько методов, направленных на работу с логикой, лежащей в основе человеческих ценностей, включая усиление и дебаты, но мы пока не знаем, как они ведут себя с реальными людьми в реалистичных ситуациях. Если проблема с алгоритмом выравнивания проявляется только в обсуждении на естественном языке сложного вопроса, нагруженного ценностями, текущие методы машинного обучения могут оказаться слишком слабыми для выявления этой проблемы.

Чтобы избежать ограничений машинного обучения, мы предлагаем эксперименты, состоящие исключительно из людей, заменяя агентов МО людьми, играющими роль этих агентов. Например, подход с использованием дебатов для выравнивания ИИ включает в себя игру с двумя ИИ-дебатерами и судьей-человеком; вместо этого мы можем использовать двух дебатеров-людей и судью-человека. Люди могут обсуждать любые интересующие нас вопросы, а выводы, сделанные на основе опыта с участием людей, можно перенести на МО.

Diagram of how human debaters apply lessons to machine debaters

Эти эксперименты с участием только людей будут мотивироваться алгоритмами машинного обучения, но не будут включать в себя какие-либо системы МО или требовать опыта в области МО. Они потребуют тщательного планирования экспериментов для конструктивного использования имеющихся знаний о том, как мыслят люди. Большинство исследователей безопасности ИИ сосредоточены на машинном обучении, чего, по нашему мнению, недостаточно для проведения подобных экспериментов.

Чтобы восполнить этот пробел, нам нужны специалисты по социальным наукам с опытом работы в области человеческого познания, поведения и этики, а также в тщательном проектировании строгих экспериментов. Поскольку вопросы, на которые нам нужно ответить, являются междисциплинарными и несколько необычными по сравнению с существующими исследованиями, мы считаем, что применимы многие области социальных наук, включая экспериментальную психологию, когнитивные науки, экономику, политологию и социальную психологию, а также смежные дисциплины, такие как нейронаука и право.

Мы верим, что тесное сотрудничество между социологами и исследователями машинного обучения будет необходимо для улучшения нашего понимания человеческого аспекта выравнивания ИИ. В качестве первого шага несколько исследователей OpenAI помогли организовать семинар в Центре перспективных исследований в области поведенческих наук (CASBS) Стэнфордского университета под руководством Мариано-Флорентино Куэльяра,  Маргарет Леви и Федерики Каругати. Мы продолжаем регулярно встречаться для обсуждения вопросов, связанных с социальными науками и выравниванием ИИ. Мы благодарим их за ценные идеи и участие в этих дискуссиях.

CASBS Logo

Наша статья— это призыв к социологам присоединиться к обеспечению безопасности ИИ. Мы находимся в процессе запуска этого исследования в OpenAI инанимаемисследователей в области социальных наук на полный рабочий день для продвижения этих экспериментов. Если вам интересна работа в этой сфере, пожалуйста, подайте заявку!

Авторы

Джеффри Ирвинг (Geoffrey Irving), Аманда Аскелл (Amanda Askell)

Полный текст статьи читайте на OpenAI