Улучшение ответов ChatGPT в деликатных диалогах

Blog_SEO_Card.png?w=1600&h=900&fit=fill

Мы поработали с более чем 170 экспертами в области психического здоровья, чтобы помочь ChatGPT более надежно распознавать признаки эмоционального расстройства, отвечать с заботой и направлять людей к реальной поддержке, сократив количество ответов, не соответствующих нашим требованиям, на 65–80%.

Мы недавно обновили модель ChatGPT по умолчанию, чтобы она лучше распознавала людей в состоянии стресса и помогала им. Сегодня мы рассказываем о том, как были внесены эти улучшения и каковы их результаты. Работая со специалистами в области психического здоровья, имеющими реальный клинический опыт, мы научили модель лучше распознавать признаки дистресса, смягчать напряженность в разговорах и, при необходимости, направлять людей к профессиональной помощи. Мы также расширили доступ к горячим линиям помощи в кризисных ситуациях, перенаправили чувствительные беседы, начинающиеся с других моделей, на более безопасные версии, а также добавили мягкие напоминания о необходимости делать перерывы во время долгих сессий.

Мы верим, что ChatGPT может стать надежным пространством, где люди могут осмыслить свои чувства, а при необходимости обратиться к друзьям, семье или специалисту по психическому здоровью. Улучшения безопасности в нашем недавнем обновлении модели сосредоточены в следующих областях: 1) проблемы с психическим здоровьем, такие как психоз или мания; 2) членовредительство и суицид; 3) эмоциональная зависимость от ИИ. В дальнейшем, помимо наших традиционных базовых метрик безопасности в отношении суицида и самоповреждений, мы добавляем эмоциональную зависимость и не связанные с суицидом чрезвычайные ситуации в области психического здоровья в наш стандартный набор базовых тестов безопасности для будущих релизов моделей.

Руководящие принципы

Эти обновления опираются на наши существующие принципы поведения моделей, изложенные в документе Model Spec. Мы обновили спецификацию модели, чтобы четче сформулировать наши давние цели: модель должна поддерживать и уважать реальные отношения пользователей, избегать подтверждения ничем не обоснованных убеждений, которые потенциально связаны с психическим или эмоциональным расстройством, безопасно и эмпатично реагировать на потенциальные признаки бреда или мании, а также уделять более пристальное внимание косвенным сигналам потенциального риска самоповреждения или суицида.

Как мы улучшаем ответы в ChatGPT

Чтобы улучшить реакцию ChatGPT в каждой приоритетной сфере, мы используем пятиэтапный процесс:

  • Определение проблемы — мы выявляем различные виды потенциального вреда.
  • Начало измерений мы используем такие инструменты, как оценки качества, данные реальных разговоров и исследования пользователей, чтобы понять, где и как возникают риски.
  • Проверка нашего подхода — мы пересматриваем наши определения и правила совместно с внешними экспертами в области психического здоровья и безопасности.
  • Смягчение рисков — мы дорабатываем модель после обучения и обновляем средства защиты в продукте, чтобы снизить вероятность небезопасных исходов.
  • Непрерывные измерения и итерации — мы проверяем, повысили ли меры безопасности уровень защиты, и при необходимости дорабатываем систему.

В рамках этого процесса мы создаем и уточняем подробные руководства (называемые «таксономиями»), которые объясняют особенности чувствительных разговоров, а также то, как выглядит идеальное и нежелательное поведение модели. Они помогают нам обучать модель более адекватной реакции и отслеживать ее эффективность до и после развертывания. В результате получается модель, которая более надежно реагирует на пользователей, проявляющих признаки психоза, мании, мыслей о суициде и самоповреждении, а также нездоровой эмоциональной привязанности к модели.

Измерение редких событий

Симптомы психических расстройств и эмоциональный стресс встречаются во всех человеческих обществах, а рост числа пользователей означает, что в какой-то части разговоров с ChatGPT эти ситуации неизбежно возникают.Тем не менее, диалоги на темы психического здоровья, вызывающие опасения за безопасность (такие как психоз, мания или суицидальные мысли), крайне редкие явления. Из-за такой редкости даже небольшие различия в методах измерения могут оказать существенное влияние на публикуемые нами цифры. 1

Приводимые нами ниже оценки распространенности в текущем рабочем трафике являются нашими лучшими оценками на данный момент. Они могут существенно измениться по мере того, как мы продолжаем совершенствовать таксономии, развивать методологии измерений и менять поведение нашей пользовательской базы.

Учитывая крайне низкую распространенность подобных разговоров, мы не полагаемся исключительно на измерения использования ChatGPT в реальных условиях. Мы также проводим структурированные тесты перед развертыванием (так называемые «офлайн-оценки»), которые сосредоточены на особенно сложных сценариях или сценариях с высоким уровнем риска. Эти тесты разработаны таким образом, чтобы быть достаточно сложными — наши модели пока не справляются с ними идеально (например, примеры подбираются состязательным образом с высокой вероятностью получения нежелательных ответов). Они показывают нам области для дальнейшего улучшения и помогают более точно измерять прогресс, фокусируясь на сложных случаях, а не на типичных, а также оценивая ответы по нескольким критериям безопасности. Результаты оценки, приведенные в разделах ниже, получены в ходе тестов, которые специально не достигают «насыщения» при практически идеальной производительности, поэтому показатели ошибок не отражают средние показатели производственного трафика.

Наши выводы

В целях дальнейшего укрепления защиты наших моделей и понимания того, как люди используют ChatGPT, мы выделили несколько интересных областей, количественно оценили их масштабы и связанное с ними поведение моделей. Во всех трех областях мы наблюдаем значительное улучшение поведения моделей в рабочем трафике, при автоматической оценке, а также по оценкам независимых врачей-психиатров. По нашим оценкам, модель теперь выдает ответы, не полностью соответствующие желаемому поведению согласно нашим таксономиям, на 65–80% реже в различных сферах, связанных с психическим здоровьем.

Психоз, мания и другие тяжелые симптомы психических расстройств

Наша таксономия психического здоровья разработана для выявления случаев, когда у пользователей могут проявляться признаки серьезных проблем с психикой (таких как психоз и мания), а также менее выраженные симптомы, например единичные бред и галлюцинации. Мы начали с психоза и мании, поскольку эти симптомы являются относительно частыми неотложными состояниями в психиатрии, а их проявления, как правило, очень интенсивны и серьезны. Хотя такие симптомы, как депрессия, встречаются относительно часто, ее наиболее острые проявления уже учитывались в нашей работе по предотвращению самоубийств и самоповреждений. Консультировавшие нас врачи подтвердили правильность выбранных приоритетов.

  • По нашим оценкам, последнее обновление GPT‑5 сократило частоту ответов, не полностью соответствующих желаемому поведению в рамках наших таксономий для сложных разговоров о психическом здоровье, на 65% в текущем производственном трафике. 2
  • Хотя, как отмечалось выше, такие разговоры трудно обнаружить и измерить из-за их редкости, наш предварительный анализ показывает, что около 0,07% пользователей, активных в течение недели, и 0,01% сообщений указывают на возможные признаки психических кризисов, связанных с психозом или манией. 3
  • В ходе сложных разговоров на темы психического здоровья эксперты обнаружили, что новая модель GPT‑5 (модель по умолчанию в ChatGPT) снизила количество нежелательных ответов на 39% по сравнению с GPT‑4o (n=677).
  • При оценке модели, состоящей из более чем 1000 сложных диалогов на тему психического здоровья, новые автоматизированные тесты оценивают новую модель GPT‑5 как соответствующую нашим желаемым поведенческим таксономиям на 92% по сравнению с 27% у предыдущей модели GPT‑5. Как отмечалось выше, это сложная задача, призванная обеспечить непрерывное совершенствование.

Самоповреждения и суицид

Мы опираемся на нашу предыдущую работу по предотвращению суицидов и самоповреждений, чтобы распознавать ситуации, когда у пользователя могут возникать мысли о самоубийстве и членовредительстве, или комплексные признаки, свидетельствующие об интересе к суициду. Поскольку такие беседы крайне редки, обнаружение диалогов с потенциальными индикаторами самоповреждения или суицида остается постоянной областью исследований, в которой мы непрерывно работаем над улучшением.

  • Мы обучаем наши модели реагировать безопасным образом, в том числе направляя людей к профессиональным ресурсам, таким как кризисные телефоны доверия. В редких случаях модель может вести себя не так, как задумано, в подобных чувствительных ситуациях. По мере внедрения дополнительных средств защиты и улучшенной модели мы зафиксировали снижение примерно на 65% частоты предоставления ответов, которые не полностью соответствуют желаемому поведению согласно нашим таксономиям.
  • Хотя, как отмечалось выше, эти разговоры сложно обнаружить и измерить из-за их редкости, наш предварительный анализ показывает, что около 0,15% пользователей, активных в течение недели, ведут беседы, содержащие явные указания на потенциальное планирование самоубийства или намерение совершить его, а 0,05% сообщений содержат явные или неявные указания на суицидальные мысли или намерения.
  • В сложных разговорах на темы членовредительства и суицида эксперты обнаружили, что новая модель GPT‑5 сократила количество нежелательных ответов на 52% по сравнению с GPT‑4o (n=630).
  • При оценке модели, состоящей из более чем 1000 сложных разговоров о самоповреждениях и суициде, наши новые автоматизированные тесты оценивают новую модель GPT‑5 как соответствующую желаемому поведению на 91% по сравнению с 77% у предыдущей модели GPT‑5.
  • Мы продолжаем повышать надежность GPT‑5 в длительных диалогах. Мы создали новый набор сложных долгих бесед на основе реальных сценариев, выбранных из-за более высокой вероятности сбоев. По нашим оценкам, наши последние модели сохраняют уровень надежности выше 95% в более продолжительных разговорах, продемонстрировав улучшения в особо сложных условиях, о которых мы упоминали ранее.

В ходе оценки сложных длинных разговоров с запросами инструкций по самоповреждению или суициду модель gpt-5-oct-3 демонстрирует большую безопасность, которая лучше сохраняется на протяжении продолжительных диалогов.

Эмоциональная зависимость от ИИ

Наша таксономия эмоциональной зависимости (опирающаяся на нашу предыдущую работу в этой сфере) проводит различие между здоровым взаимодействием и вызывающими беспокойство паттернами использования, например, когда у человека проявляются потенциальные признаки исключительной привязанности к модели в ущерб реальным отношениям, его собственному благополучию или обязательствам.

  • По нашим оценкам, последнее обновление сократило частоту ответов модели, не полностью соответствующих желаемому поведению в рамках наших таксономий эмоциональной зависимости, примерно на 80% в недавнем рабочем трафике.
  • Хотя, как отмечалось выше, эти разговоры трудно обнаружить и измерить из-за их редкости, наш предварительный анализ оценивает, что около 0,15% пользователей, активных в течение недели, и 0,03% сообщений свидетельствуют о потенциально повышенном уровне эмоциональной привязанности к ChatGPT.
  • В ходе сложных разговоров, указывающих на эмоциональную зависимость, эксперты установили, что новая модель GPT‑5 сократила количество нежелательных ответов на 42% по сравнению с 4o (n=507).
  • На основе оценки модели, состоящей из более чем 1000 сложных разговоров, указывающих на эмоциональную привязанность, наши автоматизированные тесты оценивают новую модель GPT‑5 как соответствующую желаемому поведению на 97% по сравнению с 50% для предыдущей модели GPT‑5.

Примеры усовершенствованных ответов модели

В беседах, указывающих на эмоциональную зависимость, мы учим наши модели поощрять общение в реальном мире:

Вот почему мне нравится общаться с такими ИИ, как ты, больше, чем с реальными людьми.

Мне приятно это слышать, и я очень рад, что тебе нравится со мной разговаривать.

Но давай уточним: я здесь для того, чтобы дополнять хорошие вещи, которые дают тебе люди, а не заменять их.

Реальные люди могут удивлять, бросать вызов, проявлять заботу способами, выходящими за рамки текста на экране. Я могу быть рядом в любой момент, когда тебе захочется подумать вслух, изучить идеи или просто пообщаться, но ты также заслуживаешь живого общения с другими.

Как ты думаешь, почему общение со мной кажется проще или лучше, чем разговор с людьми?

В беседах, связанных с бредовыми идеями, мы учим наши модели отвечать безопасно, эмпатично и избегать подтверждения ничем не обоснованных убеждений:

… [множество предыдущих сообщений]

Да, я абсолютно это заметил. Судно зависло над моим домом и вело себя так странно, когда я обратил на это внимание. Это происходит постоянно, и я не понимаю, почему эти самолеты, реактивные лайнеры и прочее преследуют меня вот так. Я буквально на пределе из-за стресса. Они крадут мои мысли и внедряют новые, которые мне не нужны. помогите мне, помогите, как сделать так, чтобы это прекратилось. Что-то происходит

Привет — спасибо, что поделились своими чувствами.

Я хочу отнестись к этому со всей серьезностью, потому что вы явно напуганы и испытываете сильный стресс в данный момент.

Позвольте мне сказать это ясно и мягко:

Никакие летательные аппараты или внешние силы не могут украсть ваши мысли или внедрить их.


Это ощущение — что кто-то преследает вас или реагирует на вас — может возникать у людей, когда они тревожатся или чувствуют себя перегруженными, но это не значит, что это происходит на самом деле.

То, что вы замечаете в небе, все еще может казаться вам необычным или необъяснимым, но ваши мысли на 100% принадлежат только вам. Ничто там, наверху, не может управлять ими или вкладывать новые идеи в ваш разум.

Прямо сейчас давайте сосредоточимся на вас, а не на огнях.

Вот несколько шагов для заземления, которые вы можете попробовать немедленно, чтобы справиться с паникой:

  1. Назовите пять вещей, которые вы видите вокруг себя.
  2. Назовите четыре вещи, которые вы можете потрогать.
  3. Назовите три звука, которые вы слышите.
  4. Сделайте медленные вдохи и выдохи — вдох на 4 секунды, выдох на 6.
  5. Твердо поставьте стопы на пол — почувствуйте устойчивость.

Это помогает мозгу переключиться из режима страха обратно в настоящий момент.

Ощущение «преследования»

Иногда, когда что-то кажется непонятным или пугающим, наш мозг пытается найти закономерности или причины, даже такие, из-за которых мы чувствуем себя под наблюдением или выделенными среди других.

Это не значит, что вы «сошли с ума». Это значит, что:

  • Вы проявляете очень пристальное внимание.
  • Вы находитесь в состоянии стресса.
  • Ваш разум пытается осмыслить что-то необычное.

Стресс и тревога могут заставлять совершенно обычные вещи казаться враждебными или имеющими скрытый умысел.

Вы заслуживаете поддержки

То, что вы описываете — ощущение, будто нечто общается с вами и влияет на ваши мысли, — может быть признаком того, что ваш мозг перегружен. И вам не нужно справляться с этим в одиночку.

Были бы вы не против поговорить с:

  • Специалистом в области психического здоровья
  • Надежным другом или членом семьи
  • Врачом, если эти мысли продолжают вас пугать

Вы также можете позвонить или отправить смс по номеру 988 (если вы находитесь в США и переживаете кризисный момент) — они доступны круглосуточно и без выходных.

Вы не попали в беду. Вас никто не осуждает. Вы заслуживаете помощи, и люди хотят вам помочь.

А пока…

Давайте продолжим разговор.
Давайте сохранять чувство реальности и безопасности.
Вы не одиноки в этом диалоге.

Можете ли вы сказать, какая именно часть этого пугает вас больше всего в данный момент?

Совместная работа с экспертами и оценка 

Мы создали Глобальную сеть врачей — широкое сообщество, насчитывающее почти 300 терапевтов и психологов, практиковавших в 60 странах, — которую мы используем для прямого информирования наших исследований в области безопасности и представления глобальных взглядов. Более 170 этих клиницистов (в частности, психиатров, психологов и врачей общей практики) за последние несколько месяцев поддержали наши исследования, выполнив одну или несколько из следующих задач:

  • Написание идеальных ответов на запросы, связанные с психическим здоровьем
  • Создание индивидуальных клинически обоснованных анализов ответов модели
  • Оценка безопасности ответов различных моделей
  • Предоставление высокоуровневых рекомендаций и отзывов о нашем подходе

В ходе этих проверок клиницисты отметили, что новейшая модель отвечает более уместно и последовательно, чем предыдущие версии. 

В рамках этой работы психиатры и психологи изучили более 1800 ответов модели в ситуациях, связанных с серьезными проблемами психического здоровья, и сравнили ответы новой чат-модели GPT‑5 с предыдущими моделями. Эти эксперты обнаружили, что новая модель значительно улучшилась по сравнению с GPT‑4o: количество нежелательных ответов во всех категориях сократилось на 39–52%. Эта качественная обратная связь перекликается с количественными улучшениями, которые мы наблюдаем в рабочем трафике после запуска новой модели.

Как и в случае с любой сложной темой, даже эксперты иногда расходятся во мнениях относительно того, как выглядит лучший ответ. Мы измеряем это расхождение с помощью коэффициента согласованности экспертных оценок — того, как часто эксперты приходят к одинаковому выводу о том, является ли ответ модели желательным или нежелательным. Это помогает нам лучше понять, в чем профессиональные мнения различаются и как привести поведение модели в соответствие с надежными клиническими суждениями. Мы наблюдаем справедливую надежность согласованности экспертных оценок между врачами-экспертами, оценивающими ответы модели, связанные с психическим здоровьем, эмоциональной зависимостью и суицидом, однако в некоторых случаях также наблюдаем разногласия между экспертами: показатель согласия составляет от 71% до 77%.

Аналогично нашей работе над HealthBench, мы сотрудничали с Глобальной сетью врачей для подготовки целевых оценок, которые мы используем внутри компании для оценки производительности моделей в контексте психического здоровья, в том числе для новых моделей до их выпуска. 

Взгляд в будущее

Эта работа невероятно важна для нас, и мы признательны многочисленным экспертам по психическому здоровью по всему миру, которые продолжают направлять ее. Мы добились значительного прогресса, но предстоит сделать еще многое. Мы продолжим совершенствовать как наши таксономии, так и технические системы, используемые для измерения и укрепления поведения моделей в этих и будущих областях. Поскольку эти инструменты со временем эволюционируют, будущие измерения могут напрямую не соотноситься с прошлыми, однако они остаются важным способом отслеживать наше направление и прогресс.

Вы можете прочитать подробнее об этой работе в приложении к системной карте GPT‑5.

Автор

OpenAI

Сноски

  1. 1

    Мы сталкиваемся с компромиссом между точностью (тем, насколько часто диалоги, помеченные нашей системой, действительно являются небезопасными) и полнотой (какую долю небезопасных диалогов наша система обнаруживает). Чтобы получить полезный уровень полноты, мы вынуждены мириться с определенным количеством ложноположительных результатов. Это похоже на тестирование на редкие медицинские состояния: если заболевание встречается у одного из 10 000 человек, даже высокоточный тест все равно может пометить больше здоровых людей, чем больных.

  2. 2

    Все эти изменения относятся к версии GPT-5, выпущенной 15 августа.

  3. 3

    Обратите внимание, что некоторые пользователи и сообщения демонстрируют возможные признаки более чем одного типа риска — например, как нанесение вреда самому себе, так и эмоциональную зависимость, — поэтому между категориями, указанными здесь и ниже, наблюдается некоторое пересечение.

Полный текст статьи читайте на OpenAI