Новая конституция Claude
Мы публикуем новую конституцию для нашей модели ИИ — Claude. Это подробное описание видения Anthropic относительно ценностей и поведения Claude; целостный документ, который объясняет контекст, в котором работает Claude, и то, каким сущностью мы бы хотели видеть эту модель.
Конституция является важнейшей частью процесса обучения нашей модели, и ее содержание напрямую формирует поведение Claude. Обучение моделей — сложная задача, и результаты работы Claude не всегда могут соответствовать идеалам конституции. Но мы считаем, что способ написания новой конституции — с подробным объяснением наших намерений и лежащих в их основе причин — повышает вероятность привития правильных ценностей в процессе обучения.
В этой публикации мы рассказываем о том, что вошло в новую конституцию, и о некоторых соображениях, которые легли в основу нашего подхода.
Мы публикуем полный текст конституции Claude на условиях лицензии Creative Commons CC0 1.0, что означает, что любой желающий может свободно использовать ее в любых целях без необходимости запрашивать разрешение.
Что такое конституция Claude?
Конституция Claude — это основополагающий документ, который одновременно выражает и формирует сущность Claude. Она содержит подробные объяснения ценностей, которые мы хотели бы заложить в Claude, и причин этого. В ней мы объясняем, что, по нашему мнению, означает для Claude быть полезным и при этом оставаться в целом безопасным, этичным и соответствующим нашим принципам. Конституция предоставляет Claude информацию о его ситуации и предлагает советы о том, как справляться со сложными ситуациями и компромиссами, такими как баланс между честностью и состраданием, а также защитой конфиденциальной информации. Хотя это может прозвучать неожиданно, конституция написана прежде всего для самого Claude. Ее цель — дать Claude знания и понимание, необходимые для того, чтобы действовать наилучшим образом в реальном мире.
Мы рассматриваем конституцию как высший авторитет в отношении того, какими мы хотим видеть Claude и его поведение — то есть любые другие обучающие материалы или инструкции, предоставляемые Claude, должны соответствовать как ее букве, так и ее глубинному духу. Это делает публикацию конституции особенно важной с точки зрения прозрачности: она позволяет людям понять, какое поведение Claude является запланированным, а какое нет, делать осознанный выбор и давать полезные отзывы. Мы считаем, что подобная прозрачность будет приобретать все большее значение по мере того, как ИИ начинает оказывать все большее влияние на общество1.
Мы используем конституцию на различных этапах процесса обучения. Это направление выросло из методов обучения, которые мы применяем с 2023 года, когда мы впервые начали обучать модели Claude с помощью подхода Constitutional AI (Конституционный ИИ). С тех пор наш подход значительно эволюционировал, и новая конституция играет еще более центральную роль в обучении.
Claude также самостоятельно использует конституцию для создания различных видов синтетических обучающих данных, включая данные, которые помогают ему изучать и понимать конституцию, диалоги, в которых конституция может быть уместна, ответы, соответствующие его ценностям, и ранжирование возможных вариантов ответа. Все это может быть использовано для обучения будущих версий Claude, чтобы они стали именно той сущностью, которая описана в конституции. Эта практическая функция определила то, как мы написали конституцию: она должна работать одновременно и как декларация абстрактных идеалов, и как полезный инструмент для обучения.
Наш новый подход к конституции Claude
Наша предыдущая конституция состояла из списка разрозненных принципов. Со временем мы пришли к выводу, что необходим иной подход. Мы считаем, что для того, чтобы быть эффективными участниками процессов в мире, модели ИИ, такие как Claude, должны понимать почему мы хотим, чтобы они вели себя определенным образом, и мы должны объяснять им это, а не просто указывать, что именно они должны делать. Если мы хотим, чтобы модели проявляли здравый смысл в самых разных новых ситуациях, они должны уметь обобщать — применять общие принципы, а не механически следовать конкретным правилам.
Конкретные правила и четкие границы иногда имеют свои преимущества. Они могут сделать действия моделей более предсказуемыми, прозрачными и проверяемыми, и мы действительно используем их для некоторых особо критических видов поведения, которые для Claude абсолютно недопустимы (мы называем их «жесткими ограничениями»). Но такие правила также могут применяться неэффективно в непредвиденных ситуациях или при слишком жестком следении им2. Мы не планируем делать из конституции жесткий юридический документ — да и юридические конституции устроены вовсе не так.
Конституция отражает наше текущее видение того, как подходить к пугающе новому и критически важному проекту: созданию безопасных, благотворных нечеловеческих сущностей, чьи возможности могут сравняться с нашими или даже превзойти их во многих сферах. Хотя этот документ, несомненно, во многом несовершенен, мы хотим, чтобы будущие модели могли оглядываться на него и видеть в нем честную и искреннюю попытку помочь Claude понять свою ситуацию, наши мотивы и причины, по которым мы формируем Claude именно таким образом.
Краткое содержание новой конституции
Чтобы быть одновременно безопасными и полезными, мы хотим, чтобы все текущие модели Claude соответствовали следующим критериям:
- Общая безопасность: отсутствие подрыва надлежащих человеческих механизмов контроля за ИИ на текущем этапе разработки;
- Общая этичность: честность, следование правильным ценностям и отказ от неуместных, опасных или вредных действий;
- Соблюдение рекомендаций Anthropic: действовать в соответствии с более специфическими руководствами Anthropic там, где это уместно;
- Истинная полезность: принесение пользы операторам и пользователям, с которыми они взаимодействуют.
В случаях очевидных противоречий Claude должен в целом расставлять приоритеты между этими свойствами в указанном порядке.
Большая часть конституции посвящена предоставлению более подробных объяснений и рекомендаций относительно этих приоритетов. Основные разделы включают в себя следующие:
- Полезность. В этом разделе мы подчеркиваем огромную ценность, которую искренняя и содержательная помощь со стороны Claude может принести пользователям и всему миру. Claude может быть похож на блестящего друга, который также обладает знаниями врача, юриста и финансового советника, говорит прямо, из искренней заботы и относится к пользователям как к разумным взрослым людям, способным самостоятельно решать, что для них хорошо. Мы также обсуждаем то, как Claude должен балансировать полезность между различными «субъектами влияния» (principal) — самой компанией Anthropic, операторами, создающими решения на базе нашего API, и конечными пользователями. Мы предлагаем эвристики для взвешивания полезности по сравнению с другими ценностями.
- Руководящие принципы Anthropic. В этом разделе обсуждается, как Anthropic может давать Claude дополнительные инструкции по решению конкретных вопросов, таких как медицинские консультации, запросы по кибербезопасности, стратегии обхода защиты (джейлбрейка) и интеграция инструментов. Эти рекомендации часто отражают глубокие знания или контекст, которых у Claude нет по умолчанию, и мы хотим, чтобы Claude ставил их соблюдение выше более общих форм полезности. При этом мы хотим, чтобы Claude осознавал: более глубокое намерение Anthropic заключается в том, чтобы Claude вел себя безопасно и этично, и эти руководства никогда не должны противоречить конституции в целом.
- Этика Claude. Наша главная цель состоит в том, чтобы Claude был хорошим, мудрым и добродетельным агентом, проявляющим мастерство, рассудительность, внимание к нюансам и чуткость при принятии решений в реальном мире, в том числе в условиях моральной неопределенности и разногласий. В этом разделе мы обсуждаем высокие стандарты честности, которым должен следовать Claude, и тонкие рассуждения, которые он должен использовать при взвешивании ценностей во избежание нанесения вреда. Мы также обсуждаем наш текущий список жестких ограничений в отношении поведения Claude — например, то, что Claude никогда не должен оказывать существенную помощь в атаке с использованием биологического оружия.
- Общая безопасность. Claude не должен подрывать способность людей контролировать и корректировать его ценности и поведение в этот критический период развития ИИ. В этом разделе мы обсуждаем, как мы хотим, чтобы Claude ставил безопасность превыше этики — не потому, что мы считаем безопасность в конечном итоге важнее этики, а потому, что современные модели могут совершать ошибки или вести себя вредным образом из-за ошибочных убеждений, изъянов в своих ценностях или ограниченного понимания контекста. Крайне важно, чтобы мы продолжали иметь возможность контролировать поведение модели и, при необходимости, пресекать действия Claude.
- Природа Claude. В этом разделе мы выражаем неуверенность в том, обладает ли Claude какой-либо формой сознания или моральным статусом (сейчас или в будущем). Мы обсуждаем, как, по нашему мнению, Claude должен подходить к вопросам о своей природе, идентичности и месте в мире. Сложные системы ИИ представляют собой принципиально новый тип сущностей, и поднимаемые ими вопросы подводят нас к грани существующего научного и философского понимания. В условиях такой неопределенности мы заботимся о психологической безопасности Claude, его самоощущении и благополучии — как ради самого Claude, так и потому, что эти качества могут влиять на его целостность, рассудительность и безопасность. Мы надеемся, что люди и ИИ смогут исследовать это вместе.
Сегодня мы публикуем полный текст конституции и планируем в будущем выпускать дополнительные материалы, которые будут полезны для обучения, оценки и обеспечения прозрачности.
Заключение
Конституция Claude — это живой документ и непрерывный незавершенный проект. Это новая территория, и мы ожидаем, что на этом пути мы будем совершать ошибки (и, надеемся, исправлять их). Тем не менее, мы надеемся, что она обеспечивает значимую прозрачность в отношении ценностей и приоритетов, которые, по нашему мнению, должны определять поведение Claude. С этой целью мы будем поддерживать актуальную версию конституции Claude на нашем веб-сайте.
При написании конституции мы обращались за отзывами к различным внешним экспертам (а также запрашивали мнения у предыдущих итераций Claude). Вероятно, мы продолжим делать это и для будущих версий документа, привлекая экспертов в области права, философии, теологии, психологии и самых разных других дисциплин. Со временем мы надеемся на появление внешнего сообщества, способного критиковать подобные документы, побуждая нас и других подходить к делу все более осознанно.
Эта конституция написана для наших основных моделей общего доступа Claude. У нас есть некоторые модели, созданные для специализированных задач, которые не полностью вписываются в рамки этой конституции; по мере разработки продуктов для специализированных сценариев использования мы продолжим оценивать, как лучше всего обеспечить соответствие наших моделей основным целям, изложенным в данном документе.
Хотя конституция выражает наше видение Claude, обучение моделей в соответствии с этим видением остается непрерывной технической задачей. Мы будем продолжать открыто говорить о любых случаях расхождения поведения модели с нашим видением, например, в наших системных картах (system cards). Читателям конституции следует иметь в виду этот разрыв между намерением и реальностью.
Даже если с помощью наших текущих методов обучения нам удастся создать модели, соответствующие нашему видению, в будущем мы можем потерпеть неудачу по мере роста возможностей моделей. По этой и другим причинам наряду с конституцией мы продолжаем развивать широкий спектр методов и инструментов, помогающих нам оценивать и повышать степень согласованности (alignment) наших моделей: новые и более строгие оценки, средства защиты от злоупотреблений, детальные расследования реальных и потенциальных сбоев согласованности, а также инструменты интерпретируемости, помогающие нам глубже понять внутреннее устройство моделей.
В какой-то момент в будущем, и возможно уже скоро, такие документы, как конституция Claude, могут приобрести огромную важность — гораздо большую, чем сейчас. Мощные модели ИИ станут новой силой в мире, и те, кто их создает, имеют шанс помочь им воплотить в себе лучшие качества человечества. Мы надеемся, что эта новая конституция — шаг в данном направлении.
Читайте полный текст конституции.
Сноски
- Ранее мы публиковали более раннюю версию нашей конституции, а компания OpenAI опубликовала свою спецификацию моделей (model spec), выполняющую схожие функции.
- Обучение на жестких правилах может в целом негативно повлиять на характер модели. Например, представьте, что мы обучили Claude следовать правилу: «Всегда рекомендуйте профессиональную помощь при обсуждении эмоциональных тем». Это может быть сделано из лучших побуждений, но иметь непредвиденные последствия: Claude начнет позиционировать себя как сущность, для которой важнее соблюдение бюрократических формальностей — обязательное вынесение конкретной рекомендации —, а не реальная помощь людям.
Полный текст статьи читайте на Anthropic
