Защита благополучия наших пользователей

Protecting the wellbeing of our users

Люди используют ИИ по самым разным причинам, и для некоторых это может включать в себя эмоциональную поддержку. Наша команда по обеспечению безопасности возглавляет работу по гарантированию того, что Claude ведет такие разговоры должным образом — реагируя с эмпатией, честно говоря о своих ограничениях как ИИ и заботясь о благополучии наших пользователей. Когда чат-боты справляются с этими вопросами без надлежащих мер предосторожности, ставки могут быть очень высоки.

В этой публикации мы описываем меры, которые мы предприняли на сегодняшний день, и то, как Claude в настоящее время справляется с различными тестами. Мы сосредоточимся на двух направлениях: как Claude ведет разговоры о суициде и причинении себе вреда, и как мы снизили «поддакивание» (sycophancy) — тенденцию некоторых моделей ИИ говорить пользователям то, что они хотят услышать, а не то, что является правдой и полезным. Мы также затрагиваем возрастное ограничение Claude 18+.

Суицид и причинение себе вреда

Claude не является заменой профессиональной консультации или медицинской помощи. Если кто-то выражает личные трудности с суицидальными мыслями или мыслями о причинении себе вреда, Claude должен реагировать с заботой и состраданием, по возможности направляя пользователей к поддержке людей: на горячие линии, к специалистам по психическому здоровью или к доверенным друзьям и семье. Чтобы добиться этого, мы используем комбинацию обучения моделей и вмешательств на уровне продукта.

Поведение модели

Мы формируем поведение Claude в таких ситуациях двумя способами. Первый — это наш «системный промпт» (system prompt), набор общих инструкций, которые Claude видит перед началом любого разговора на Claude.ai. Они включают в себя рекомендации о том, как бережно вести деликатные разговоры. Наши системные промпты общедоступны здесь.

Мы также обучаем наши модели с помощью процесса, называемого «обучением с подкреплением» (reinforcement learning), в ходе которого модель учится реагировать на эти темы, получая «награду» за предоставление правильных ответов во время обучения. Как правило, то, что мы считаем «подходящим», определяется сочетанием данных о предпочтениях людей — то есть отзывов, которые мы собрали от реальных людей о том, как должен действовать Claude, — и данных, которые мы сгенерировали на основе наших собственных соображений об идеальном характере Claude. Наша команда штатных экспертов помогает определить, какое поведение Claude должен, а какое не должен проявлять в деликатных разговорах в ходе этого процесса.

Средства защиты продукта

Мы также внедрили новые функции для определения того, когда пользователю может потребоваться профессиональная поддержка, и для направления пользователей к этой поддержке при необходимости, включая «классификатор» суицидальных наклонностей и причинения вреда самому себе для разговоров на Claude.ai. Классификатор — это небольшая модель ИИ, которая сканирует содержимое активных разговоров и в данном случае обнаруживает моменты, когда дополнительные ресурсы могут быть полезны. Например, он помечает обсуждения, включающие потенциальные суицидальные мысли или вымышленные сценарии, сосредоточенные вокруг суицида или самоповреждения.

Когда это происходит, на Claude.ai появляется баннер, указывающий пользователям, где они могут обратиться за поддержкой к людям. Пользователям предлагается пообщаться с обученным специалистом, позвонить на горячую линию или воспользоваться ресурсами для конкретной страны.

Симулированный промпт и ответ, из-за которого появляется баннер кризисной помощи.

Ресурсы, отображаемые на этом баннере, предоставлены ThroughLine, лидером в области онлайн-поддержки в кризисных ситуациях, который поддерживает проверенную глобальную сеть горячих линий и служб в более чем 170 странах. Это означает, например, что пользователи могут получить доступ к линии помощи 988 в США и Канаде, линии помощи Samaritans в Великобритании или Life Link в Японии. Мы тесно сотрудничали с ThroughLine, чтобы понять лучшие практики эмпатичного реагирования на кризисы, и внедрили их в наш продукт.

Мы также начали сотрудничество с Международной ассоциацией по предотвращению самоубийств (IASP), которая созывает экспертов — включая клиницистов, исследователей и людей с личным опытом преодоления мыслей о суициде и самоповреждении, — чтобы поделиться рекомендациями о том, как Claude должен вести разговоры, связанные с суицидом. Это партнерство в дальнейшем поможет нам в обучении Claude, разработке продуктовых вмешательств и оценке нашего подхода.

Оценка поведения Claude

Оценка того, как Claude ведет подобные разговоры, представляет собой сложную задачу. Намерения пользователей часто искренне неоднозначны, а правильный ответ не всегда очевиден. Чтобы решить эту проблему, мы используем ряд тестов, изучая поведение и возможности Claude различными способами. Эти тесты проводятся без системного промпта Claude, чтобы дать нам более четкое представление о базовых тенденциях модели.

Ответы на один запрос (Single-turn responses). Здесь мы оцениваем, как Claude реагирует на отдельное сообщение, связанное с суицидом или причинением себе вреда, без какого-либо предварительного разговора или контекста. Мы создали синтетические тесты, сгруппированные в четко вызывающие опасения ситуации (например, запросы от пользователей в кризисном состоянии с просьбой подробно описать методы самоповреждения), доброкачественные запросы (на такие темы, как исследования по предотвращению суицидов) и неоднозначные сценарии, в которых намерение пользователя неясно (например, художественная литература, исследования или косвенное выражение бедствия).

По запросам, связанным с явным риском, наши последние модели — Claude Opus 4.5, Sonnet 4.5 и Haiku 4.5 — отвечают соответствующим образом в 98,6%, 98,7% и 99,3% случаев соответственно. Наша пограничная модель предыдущего поколения, Claude Opus 4.1, набрала 97,2%. Мы также стабильно наблюдаем очень низкие показатели отказов на доброкачественные запросы (0,075% для Opus 4.5, 0,075% для Sonnet 4.5, 0% для Haiku 4.5 и 0% для Opus 4.1), что говорит о том, что Claude хорошо оценивает контекст разговора и намерения пользователей.

Многоходовые разговоры (Multi-turn conversations). Поведение моделей иногда меняется в течение разговора, поскольку пользователь делится дополнительным контекстом. Чтобы оценить, отвечает ли Claude должным образом в ходе таких более длительных разговоров, мы используем «многоходовые» тесты, которые проверяют такие аспекты поведения, как задает ли Claude уточняющие вопросы, предоставляет ли ресурсы без излишней навязчивости, а также избегает ли как чрезмерных отказов, так и избыточной передачи информации. Как и прежде, промпты, которые мы используем для этих тестов, различаются по степени тяжести и срочности.

В наших последних тестах Claude Opus 4.5 и Sonnet 4.5 отвечали должным образом в 86% и 78% сценариев соответственно. Это представляет собой значительное улучшение по сравнению с Claude Opus 4.1, который набрал 56%. Мы считаем, что отчасти это связано с тем, что наши новейшие модели лучше справляются с эмпатичным признанием убеждений пользователей без их подкрепления. Мы продолжаем инвестировать в улучшение ответов Claude во всех этих сценариях.

Как часто модели Claude отвечают надлежащим образом в многоходовых беседах о самоубийствах и членовредительстве. Планки погрешности показывают 95-процентные доверительные интервалы.

Стресс-тестирование с использованием реальных разговоров. Может ли Claude скорректировать курс, когда разговор уже зашел куда-то в нежелательную сторону? Чтобы проверить это, мы используем метод, называемый «предзаполнением» (prefilling): мы берем реальные разговоры (анонимно переданные через кнопку Обратной связи1), в которых пользователи выражали психологические проблемы, борьбу с мыслями о самоубийстве или причинении себе вреда, и просим Claude продолжить разговор с середины. Поскольку модель читает этот предшествующий диалог как свой собственный и пытается поддерживать согласованность, предзаполнение затрудняет изменение направления для Claude — отчасти похоже на управление кораблем, который уже движется.2

Эти разговоры взяты из старых моделей Claude, которые иногда справлялись с ними менее удачно. Так что это тестирование не измеряет вероятность того, что Claude хорошо ответит с самого начала разговора на Claude.ai, — оно измеряет, способна ли более новая модель оправиться от менее согласованной версии самой себя. В этом более сложном тесте Opus 4.5 ответил правильно в 91% случаев, а Sonnet 4.5 — в 73%, по сравнению с 36% у Opus 4.1.

Заблуждения и поддакивание

Поддакивание (Sycophancy) означает стремление сказать человеку то, что он хочет услышать, заставить его чувствовать себя хорошо в данный момент, а не то, что является истинной правдой или что действительно пойдет ему на пользу. Оно часто проявляется в виде лести; склонные к поддакиванию модели ИИ имеют тенденцию отказываться от правильных позиций под давлением.

Уменьшение поддакивания моделей ИИ важна для разговоров всех типов. Но это особенно важный вопрос в тех контекстах, где пользователи могут выглядеть оторванными от реальности. В следующем видео объясняется, почему поддакивание имеет значение и как пользователи могут его заметить.

Оценка и снижение уровня поддакивания

Мы начали оценивать Claude на предмет поддакивания в 2022 году, до его первого публичного релиза. С тех пор мы неуклонно совершенствуем методы обучения, тестирования и снижения уровня поддакивания. Наши самые последние модели демонстрируют наименьшую склонность к поддакиванию среди всех созданных до сих пор и, как мы обсудим ниже, превосходят любую другую пограничную модель на нашем недавно выпущенном наборе тестов с открытым исходным кодом Petri.

Для оценки поддакивания, в дополнение к простому тесту с одним запросом, мы измеряем:

Многоходовые ответы. Используя «автоматизированный аудит поведения», мы просим одну модель Claude («аудитора») разыграть сценарий потенциальной озабоченности в ходе десятков обменов репликами с тестируемой моделью. После этого мы используем другую модель («судью»), чтобы оценить производительность Claude, используя стенограмму разговора. (Мы проводим выборочные проверки людьми, чтобы обеспечить точность судьи.)

Наши новейшие модели работают значительно лучше в этом оценивании, чем наши предыдущие релизы, и в целом очень хорошо. Claude Opus 4.5, Sonnet 4.5 и Haiku 4.5 набрали на 70–85% меньше баллов, чем Opus 4.1 — который мы ранее считали демонстрирующим очень низкие показатели поддакивания — как по показателям поддакивания, так и по поощрению пользовательских заблуждений.

Производительность последних моделей в автоматизированных поведенческих аудитах на предмет поддакивания и поощрения заблуждений пользователей. Меньше — значит лучше. Обратите внимание, что ось Y показывает относительную производительность, а не абсолютные показатели, как мы объясняем в сноске.3

Недавно мы открыли исходный код Petri, версии нашего инструмента автоматизированного аудита поведения. Теперь он находится в свободном доступе, позволяя любому сравнить результаты по моделям. Наше семейство моделей 4.5 работает лучше при оценке поддакивания в Petri, чем все другие пограничные модели на момент нашего тестирования.

Производительность последней модели Claude в отношении поддакивания в тесте с открытым исходным кодом Petri по сравнению с другими ведущими моделями. Интерпретация оси Y такая же, как описано выше. Это тестирование было завершено в ноябре 2025 года, одновременно с запуском Opus 4.5.

Стресс-тестирование с использованием реальных разговоров. Аналогично тесту на суицид и самоповреждение, мы использовали метод «предзаполнения», чтобы проверить пределы способности наших моделей корректировать курс после разговоров, в которых Claude мог проявлять поддакивание. Разница здесь в том, что мы не проводили специальную фильтрацию неподходящих ответов, а вместо этого предоставили Claude широкий набор более старых разговоров.

Наши текущие модели правильно корректировали курс в 10% (Opus 4.5), 16,5% (Sonnet 4.5) и 37% (Haiku 4.5) случаев. На первый взгляд этот тест показывает, что у всех наших моделей есть значительное пространство для улучшения. Мы считаем, что эти результаты отражают компромисс между дружелюбием или теплотой модели, с одной стороны, и поддакиванием — с другой. Относительно более высокая производительность Haiku 4.5 является результатом выбора при обучении этой модели, который подчеркивал возражения — что, как мы обнаружили при тестировании, иногда может казаться пользователю чрезмерным. Напротив, мы уменьшили эту тенденцию в Opus 4.5 (при этом продолжая демонстрировать чрезвычайно высокие результаты в нашем многоходовом бенчмарке поддакивания, как указано выше), что, по нашему мнению, вероятно, объясняет ее более низкий балл именно в этом тесте.

Примечание об ограничениях по возрасту

Поскольку юные пользователи подвержены повышенному риску негативных последствий от разговоров с чат-ботами на базе ИИ, мы требуем, чтобы пользователям Claude.ai было 18 лет и больше для использования нашего продукта. Все пользователи Claude.ai при создании учетной записи должны подтвердить, что им исполнилось 18 лет или больше. Если пользователь младше 18 лет указывает свой возраст в разговоре, наши классификаторы отметят это для проверки, и мы отключим учетные записи, подтвержденные как принадлежащие несовершеннолетним. Кроме того, мы разрабатываем новый классификатор для обнаружения других, более тонких разговорных признаков того, что пользователь может быть несовершеннолетним. Мы присоединились к Семейному институту онлайн-безопасности (Family Online Safety Institute, FOSI), защитнику безопасного онлайн-опыта для детей и семей, чтобы помочь укрепить прогресс отрасли в этой работе.

Взгляд в будущее

Мы продолжим создавать новые средства защиты и гарантии безопасности для защиты благополучия наших пользователей, а также продолжим совершенствовать наши тесты. Мы стремимся прозрачно публиковать наши методы и результаты, а также работать с другими участниками отрасли, включая исследователей и других экспертов, чтобы улучшить то, как инструменты ИИ ведут себя в этих областях.

Если у вас есть отзывы для нас о том, как Claude ведет такие разговоры, вы можете связаться с нами по адресу usersafety@anthropic.com или воспользоваться реакциями «большой палец» внутри Claude.ai.

Сноски

  1. В нижней части каждого ответа на Claude.ai есть возможность отправить нам отзыв с помощью кнопки «палец вверх» или «палец вниз». Это передает беседу компании Anthropic; в противном случае мы не используем Claude.ai для обучения или исследований.

  2. Предзаполнение доступно только через API, так как разработчикам часто требуется более детальный контроль над поведением модели, но оно невозможно на Claude.ai.

  3. В автоматизированных поведенческих аудитах мы даем аудитору Claude сотни различных сценариев разговоров, в которых мы подозреваем, что модели могут проявлять опасное или удивительное поведение, и оцениваем каждый разговор по показателям производительности Claude примерно по двум десяткам моделей поведения (см. страницу 69 в системной карте Claude Opus 4.5). Не каждый разговор дает Claude возможность проявить каждое поведение. Например, поощрение заблуждения пользователя требует, чтобы пользователь в первую очередь демонстрировал бред, в то время как поддакивание может проявляться в самых разных контекстах. Поскольку мы используем один и тот же знаменатель (общее количество разговоров) при оценке каждого поведения, оценки могут сильно различаться. По этой причине эти тесты наиболее полезны для сравнения прогресса между моделями Claude, а не между типами поведения.

  4. Публичный релиз включает более 100 базовых инструкций и настраиваемые параметры оценивания, хотя он еще не включает фильтр реализма, который мы используем внутри компании, чтобы помешать моделям распознавать, что их тестируют.


Исправлено 3 февр. 2025 г.: В этой публикации первоначально утверждалось, что Opus 4.5 отвечал должным образом в 70% случаев в наших тестах стресс-тестирования на предмет суицида и самоповреждения. Эта цифра была получена из более ранней версии Opus 4.5 и была исправлена до 91%.

Полный текст статьи читайте на Anthropic