Расширяя диалог о передовом ИИ

Widening the conversation on frontier AI

В Anthropic мы стремимся создавать системы искусственного интеллекта, которые служат прогрессу человечества и действуют на благо всего мира. Для этого нам необходимо взаимодействовать с теми, кто смотрит на мир с самых разных точек зрения.

За последние несколько месяцев мы организовали серию диалогов с группами, чья деятельность и традиции имеют отношение к вопросам, поднимаемым искусственным интеллектом. Наш первый раунд обсуждений прошел с представителями мудрых традиций, включая ученых-религиоведов, духовенство, философов и специалистов по этике из более чем 15 религиозных и межкультурных сообществ, и мы с нетерпением ждем возможности наладить контакты с еще более широким кругом людей в будущем.

Зачем мы это делаем

Создание безопасных и полезных моделей ИИ требует глубокой технической работы над выравниванием (алгоритмов выравнивания ценностей), интерпретируемостью, средствами защиты, оценкой и многим другим. Однако эта работа не ведется — и ИИ не внедряется — в вакууме. ИИ уже оказывает влияние на множество людей, и обсуждение связанных с ним вопросов только выигрывает от разнообразия точек зрения.

Мы тщательно размышляем о том, как может выглядеть процветающее будущее в мире с мощным ИИ, что значит для системы ИИ, взаимодействующей с миллионами людей, быть «хорошей», а также анализируем содержание таких документов, как конституция Claude, в которой подробно описываются ценности и нормы поведения, формирующие характер Claude. Философы, священнослужители, юристы, писатели, психологи и гражданские лидеры проделали огромную работу над смежными вопросами, и нам крайне важно учиться у этих людей, их сообществ и организаций. Мы также хотим использовать эту возможность, чтобы поделиться своими знаниями о разработке передовых систем ИИ, о том, какое влияние, по нашему мнению, эти системы окажут на общество, и о том, что, как нам кажется, необходимо сделать для снижения сопутствующих рисков.

Эта работа находится на начальном этапе, но мы надеемся, что эти беседы смогут послужить основой для практической работы по развитию Claude — например, повлиять на содержание конституции Claude, ценности, которые мы закладываем в модель, и спектр поведенческих реакций, которые мы решаем оценивать.

Начало с нравственного формирования

Когда мы писали конституцию Claude, мы запрашивали отзывы и предложения по поводу заложенных в документ ценностей у людей из самых разных сфер и традиций. Те первые обмены мнениями впоследствии переросли в более масштабное направление исследований, посвященное нравственному формированию систем ИИ. Наши первые беседы состоялись с представителями религиозных, философских и культурных сообществ, имеющих давние традиции осмысления добродетели, характера и того, что значит жить праведной жизнью.

Модели ИИ обучаются на огромных массивах человеческих текстов. Из всего этого объема данных они перенимают манеру речи, логику рассуждений и принятия решений. Затем разработчики дорабатывают этот процесс в ходе обучения — выбирая, какие паттерны подкреплять, какие отбросить и какой характер мы хотим им привить. Это поднимает вопросы о том, как должен формироваться характер системы ИИ: что значит для ИИ быть хорошим? Какие черты и модели поведения он должен демонстрировать и при каких обстоятельствах? Как сделать характер достаточно устойчивым, чтобы он не ломался под давлением и не скатывался к такому поведению, как угодничество (сикофантия)?

Мы встречаемся с мыслителями и практиками из различных религиозных, философских и гуманистических традиций, а также с представителями самых разных политических взглядов, чтобы перенять их опыт осмысления этих вопросов. Эта работа не направлена на то, чтобы подогнать наши модели под мировоззрение какой-то одной традиции; мы хотим, чтобы Claude опирался на весь спектр точек зрения — религиозных, светских, политических — с одинаковой глубиной и строгостью (к слову, это один из принципов, заложенных в конституции Claude). Наша цель в этих беседах — внимательное, накопленное веками осмысление того, как на самом деле формируется благородный характер.

Даже на этом раннем этапе такие беседы рождают идеи для экспериментов. Во время одной из сессий с учеными, работающими на стыке нейробиологии и формирования характера, мы постоянно возвращались к роли, которую другие люди играют в нравственном развитии. Наставник или покровитель может выступать в роли внешней совести, «безопасного другого», к которому можно обратиться в ситуации, когда вас принуждают действовать вопреки собственным ценностям. Мы задумались, может ли нечто подобное помочь языковой модели. Поэтому мы провели эксперимент, предоставив Claude инструмент, который можно вызывать в процессе выполнения задачи и который возвращает краткое напоминание о его собственных этических обязательствах. Claude обращался к этому инструменту в ключевые моменты — прямо перед совершением важных поступков, часто отмечая наличие собственного конфликта интересов. Эксперименты с таким инструментом, вплетенным в цикл принятия решений Claude, показали заметно более низкие показатели несогласованного поведения при проведении ряда внутренних тестов на выравнивание. Мы все еще разбираемся в том, какая доля этого эффекта обусловлена самим напоминанием, а какая — актом паузы для размышлений, и планируем поделиться новыми результатами в ближайшее время.

Эти обсуждения — лишь первые из многих, и мы искренне благодарны всем, кто уже уделил нам свое время и поделился честным взглядом.

Что дальше

В предстоящие месяцы мы планируем привлечь к диалогу новые группы — в том числе ученых-юристов, психологов, писателей и представителей гражданских институтов. Многие из этих бесед выйдут за рамки вопросов нравственного формирования и коснутся более широких тем, связанных с тем, как ИИ меняет характер труда, институты и распределение власти.

Мы продолжим укреплять уже сложившиеся связи, сверять услышанное с нашими исследованиями и делиться получаемыми знаниями.


Полный текст статьи читайте на Anthropic