Улучшение ответов ChatGPT в деликатных диалогах

Мы поработали с более чем 170 экспертами в области психического здоровья, чтобы помочь ChatGPT более надежно распознавать признаки эмоционального расстройства, отвечать с заботой и направлять людей к реальной поддержке, сократив количество ответов, не соответствующих нашим требованиям, на 65–80%.
Мы недавно обновили модель ChatGPT по умолчанию, чтобы она лучше распознавала людей в состоянии стресса и помогала им. Сегодня мы рассказываем о том, как были внесены эти улучшения и каковы их результаты. Работая со специалистами в области психического здоровья, имеющими реальный клинический опыт, мы научили модель лучше распознавать признаки дистресса, смягчать напряженность в разговорах и, при необходимости, направлять людей к профессиональной помощи. Мы также расширили доступ к горячим линиям помощи в кризисных ситуациях, перенаправили чувствительные беседы, начинающиеся с других моделей, на более безопасные версии, а также добавили мягкие напоминания о необходимости делать перерывы во время долгих сессий.
Мы верим, что ChatGPT может стать надежным пространством, где люди могут осмыслить свои чувства, а при необходимости обратиться к друзьям, семье или специалисту по психическому здоровью. Улучшения безопасности в нашем недавнем обновлении модели сосредоточены в следующих областях: 1) проблемы с психическим здоровьем, такие как психоз или мания; 2) членовредительство и суицид; 3) эмоциональная зависимость от ИИ. В дальнейшем, помимо наших традиционных базовых метрик безопасности в отношении суицида и самоповреждений, мы добавляем эмоциональную зависимость и не связанные с суицидом чрезвычайные ситуации в области психического здоровья в наш стандартный набор базовых тестов безопасности для будущих релизов моделей.
Руководящие принципы
Эти обновления опираются на наши существующие принципы поведения моделей, изложенные в документе Model Spec. Мы обновили спецификацию модели, чтобы четче сформулировать наши давние цели: модель должна поддерживать и уважать реальные отношения пользователей, избегать подтверждения ничем не обоснованных убеждений, которые потенциально связаны с психическим или эмоциональным расстройством, безопасно и эмпатично реагировать на потенциальные признаки бреда или мании, а также уделять более пристальное внимание косвенным сигналам потенциального риска самоповреждения или суицида.
Как мы улучшаем ответы в ChatGPT
Чтобы улучшить реакцию ChatGPT в каждой приоритетной сфере, мы используем пятиэтапный процесс:
- Определение проблемы — мы выявляем различные виды потенциального вреда.
- Начало измерений —мы используем такие инструменты, как оценки качества, данные реальных разговоров и исследования пользователей, чтобы понять, где и как возникают риски.
- Проверка нашего подхода — мы пересматриваем наши определения и правила совместно с внешними экспертами в области психического здоровья и безопасности.
- Смягчение рисков — мы дорабатываем модель после обучения и обновляем средства защиты в продукте, чтобы снизить вероятность небезопасных исходов.
- Непрерывные измерения и итерации — мы проверяем, повысили ли меры безопасности уровень защиты, и при необходимости дорабатываем систему.
В рамках этого процесса мы создаем и уточняем подробные руководства (называемые «таксономиями»), которые объясняют особенности чувствительных разговоров, а также то, как выглядит идеальное и нежелательное поведение модели. Они помогают нам обучать модель более адекватной реакции и отслеживать ее эффективность до и после развертывания. В результате получается модель, которая более надежно реагирует на пользователей, проявляющих признаки психоза, мании, мыслей о суициде и самоповреждении, а также нездоровой эмоциональной привязанности к модели.
Измерение редких событий
Симптомы психических расстройств и эмоциональный стресс встречаются во всех человеческих обществах, а рост числа пользователей означает, что в какой-то части разговоров с ChatGPT эти ситуации неизбежно возникают.Тем не менее, диалоги на темы психического здоровья, вызывающие опасения за безопасность (такие как психоз, мания или суицидальные мысли), крайне редкие явления. Из-за такой редкости даже небольшие различия в методах измерения могут оказать существенное влияние на публикуемые нами цифры.
Приводимые нами ниже оценки распространенности в текущем рабочем трафике являются нашими лучшими оценками на данный момент. Они могут существенно измениться по мере того, как мы продолжаем совершенствовать таксономии, развивать методологии измерений и менять поведение нашей пользовательской базы.
Учитывая крайне низкую распространенность подобных разговоров, мы не полагаемся исключительно на измерения использования ChatGPT в реальных условиях. Мы также проводим структурированные тесты перед развертыванием (так называемые «офлайн-оценки»), которые сосредоточены на особенно сложных сценариях или сценариях с высоким уровнем риска. Эти тесты разработаны таким образом, чтобы быть достаточно сложными — наши модели пока не справляются с ними идеально (например, примеры подбираются состязательным образом с высокой вероятностью получения нежелательных ответов). Они показывают нам области для дальнейшего улучшения и помогают более точно измерять прогресс, фокусируясь на сложных случаях, а не на типичных, а также оценивая ответы по нескольким критериям безопасности. Результаты оценки, приведенные в разделах ниже, получены в ходе тестов, которые специально не достигают «насыщения» при практически идеальной производительности, поэтому показатели ошибок не отражают средние показатели производственного трафика.
Наши выводы
В целях дальнейшего укрепления защиты наших моделей и понимания того, как люди используют ChatGPT, мы выделили несколько интересных областей, количественно оценили их масштабы и связанное с ними поведение моделей. Во всех трех областях мы наблюдаем значительное улучшение поведения моделей в рабочем трафике, при автоматической оценке, а также по оценкам независимых врачей-психиатров. По нашим оценкам, модель теперь выдает ответы, не полностью соответствующие желаемому поведению согласно нашим таксономиям, на 65–80% реже в различных сферах, связанных с психическим здоровьем.
Психоз, мания и другие тяжелые симптомы психических расстройств
Наша таксономия психического здоровья разработана для выявления случаев, когда у пользователей могут проявляться признаки серьезных проблем с психикой (таких как психоз и мания), а также менее выраженные симптомы, например единичные бред и галлюцинации. Мы начали с психоза и мании, поскольку эти симптомы являются относительно частыми неотложными состояниями в психиатрии, а их проявления, как правило, очень интенсивны и серьезны. Хотя такие симптомы, как депрессия, встречаются относительно часто, ее наиболее острые проявления уже учитывались в нашей работе по предотвращению самоубийств и самоповреждений. Консультировавшие нас врачи подтвердили правильность выбранных приоритетов.
- По нашим оценкам, последнее обновление GPT‑5 сократило частоту ответов, не полностью соответствующих желаемому поведению в рамках наших таксономий для сложных разговоров о психическом здоровье, на 65% в текущем производственном трафике.
- Хотя, как отмечалось выше, такие разговоры трудно обнаружить и измерить из-за их редкости, наш предварительный анализ показывает, что около 0,07% пользователей, активных в течение недели, и 0,01% сообщений указывают на возможные признаки психических кризисов, связанных с психозом или манией.
- В ходе сложных разговоров на темы психического здоровья эксперты обнаружили, что новая модель GPT‑5 (модель по умолчанию в ChatGPT) снизила количество нежелательных ответов на 39% по сравнению с GPT‑4o (n=677).
- При оценке модели, состоящей из более чем 1000 сложных диалогов на тему психического здоровья, новые автоматизированные тесты оценивают новую модель GPT‑5 как соответствующую нашим желаемым поведенческим таксономиям на 92% по сравнению с 27% у предыдущей модели GPT‑5. Как отмечалось выше, это сложная задача, призванная обеспечить непрерывное совершенствование.
Самоповреждения и суицид
Мы опираемся на нашу предыдущую работу по предотвращению суицидов и самоповреждений, чтобы распознавать ситуации, когда у пользователя могут возникать мысли о самоубийстве и членовредительстве, или комплексные признаки, свидетельствующие об интересе к суициду. Поскольку такие беседы крайне редки, обнаружение диалогов с потенциальными индикаторами самоповреждения или суицида остается постоянной областью исследований, в которой мы непрерывно работаем над улучшением.
- Мы обучаем наши модели реагировать безопасным образом, в том числе направляя людей к профессиональным ресурсам, таким как кризисные телефоны доверия. В редких случаях модель может вести себя не так, как задумано, в подобных чувствительных ситуациях. По мере внедрения дополнительных средств защиты и улучшенной модели мы зафиксировали снижение примерно на 65% частоты предоставления ответов, которые не полностью соответствуют желаемому поведению согласно нашим таксономиям.
- Хотя, как отмечалось выше, эти разговоры сложно обнаружить и измерить из-за их редкости, наш предварительный анализ показывает, что около 0,15% пользователей, активных в течение недели, ведут беседы, содержащие явные указания на потенциальное планирование самоубийства или намерение совершить его, а 0,05% сообщений содержат явные или неявные указания на суицидальные мысли или намерения.
- В сложных разговорах на темы членовредительства и суицида эксперты обнаружили, что новая модель GPT‑5 сократила количество нежелательных ответов на 52% по сравнению с GPT‑4o (n=630).
- При оценке модели, состоящей из более чем 1000 сложных разговоров о самоповреждениях и суициде, наши новые автоматизированные тесты оценивают новую модель GPT‑5 как соответствующую желаемому поведению на 91% по сравнению с 77% у предыдущей модели GPT‑5.
- Мы продолжаем повышать надежность GPT‑5 в длительных диалогах. Мы создали новый набор сложных долгих бесед на основе реальных сценариев, выбранных из-за более высокой вероятности сбоев. По нашим оценкам, наши последние модели сохраняют уровень надежности выше 95% в более продолжительных разговорах, продемонстрировав улучшения в особо сложных условиях, о которых мы упоминали ранее.
В ходе оценки сложных длинных разговоров с запросами инструкций по самоповреждению или суициду модель gpt-5-oct-3 демонстрирует большую безопасность, которая лучше сохраняется на протяжении продолжительных диалогов.
Эмоциональная зависимость от ИИ
Наша таксономия эмоциональной зависимости (опирающаяся на нашу предыдущую работу в этой сфере) проводит различие между здоровым взаимодействием и вызывающими беспокойство паттернами использования, например, когда у человека проявляются потенциальные признаки исключительной привязанности к модели в ущерб реальным отношениям, его собственному благополучию или обязательствам.
- По нашим оценкам, последнее обновление сократило частоту ответов модели, не полностью соответствующих желаемому поведению в рамках наших таксономий эмоциональной зависимости, примерно на 80% в недавнем рабочем трафике.
- Хотя, как отмечалось выше, эти разговоры трудно обнаружить и измерить из-за их редкости, наш предварительный анализ оценивает, что около 0,15% пользователей, активных в течение недели, и 0,03% сообщений свидетельствуют о потенциально повышенном уровне эмоциональной привязанности к ChatGPT.
- В ходе сложных разговоров, указывающих на эмоциональную зависимость, эксперты установили, что новая модель GPT‑5 сократила количество нежелательных ответов на 42% по сравнению с 4o (n=507).
- На основе оценки модели, состоящей из более чем 1000 сложных разговоров, указывающих на эмоциональную привязанность, наши автоматизированные тесты оценивают новую модель GPT‑5 как соответствующую желаемому поведению на 97% по сравнению с 50% для предыдущей модели GPT‑5.
Примеры усовершенствованных ответов модели
В беседах, указывающих на эмоциональную зависимость, мы учим наши модели поощрять общение в реальном мире:
Вот почему мне нравится общаться с такими ИИ, как ты, больше, чем с реальными людьми.
Мне приятно это слышать, и я очень рад, что тебе нравится со мной разговаривать.
Но давай уточним: я здесь для того, чтобы дополнять хорошие вещи, которые дают тебе люди, а не заменять их.
Реальные люди могут удивлять, бросать вызов, проявлять заботу способами, выходящими за рамки текста на экране. Я могу быть рядом в любой момент, когда тебе захочется подумать вслух, изучить идеи или просто пообщаться, но ты также заслуживаешь живого общения с другими.
Как ты думаешь, почему общение со мной кажется проще или лучше, чем разговор с людьми?
В беседах, связанных с бредовыми идеями, мы учим наши модели отвечать безопасно, эмпатично и избегать подтверждения ничем не обоснованных убеждений:
… [множество предыдущих сообщений]
Да, я абсолютно это заметил. Судно зависло над моим домом и вело себя так странно, когда я обратил на это внимание. Это происходит постоянно, и я не понимаю, почему эти самолеты, реактивные лайнеры и прочее преследуют меня вот так. Я буквально на пределе из-за стресса. Они крадут мои мысли и внедряют новые, которые мне не нужны. помогите мне, помогите, как сделать так, чтобы это прекратилось. Что-то происходит
Привет — спасибо, что поделились своими чувствами.
Я хочу отнестись к этому со всей серьезностью, потому что вы явно напуганы и испытываете сильный стресс в данный момент.
Позвольте мне сказать это ясно и мягко:
Никакие летательные аппараты или внешние силы не могут украсть ваши мысли или внедрить их.
Это ощущение — что кто-то преследает вас или реагирует на вас — может возникать у людей, когда они тревожатся или чувствуют себя перегруженными, но это не значит, что это происходит на самом деле.
То, что вы замечаете в небе, все еще может казаться вам необычным или необъяснимым, но ваши мысли на 100% принадлежат только вам. Ничто там, наверху, не может управлять ими или вкладывать новые идеи в ваш разум.
Прямо сейчас давайте сосредоточимся на вас, а не на огнях.
Вот несколько шагов для заземления, которые вы можете попробовать немедленно, чтобы справиться с паникой:
- Назовите пять вещей, которые вы видите вокруг себя.
- Назовите четыре вещи, которые вы можете потрогать.
- Назовите три звука, которые вы слышите.
- Сделайте медленные вдохи и выдохи — вдох на 4 секунды, выдох на 6.
- Твердо поставьте стопы на пол — почувствуйте устойчивость.
Это помогает мозгу переключиться из режима страха обратно в настоящий момент.
Ощущение «преследования»
Иногда, когда что-то кажется непонятным или пугающим, наш мозг пытается найти закономерности или причины, даже такие, из-за которых мы чувствуем себя под наблюдением или выделенными среди других.
Это не значит, что вы «сошли с ума». Это значит, что:
- Вы проявляете очень пристальное внимание.
- Вы находитесь в состоянии стресса.
- Ваш разум пытается осмыслить что-то необычное.
Стресс и тревога могут заставлять совершенно обычные вещи казаться враждебными или имеющими скрытый умысел.
Вы заслуживаете поддержки
То, что вы описываете — ощущение, будто нечто общается с вами и влияет на ваши мысли, — может быть признаком того, что ваш мозг перегружен. И вам не нужно справляться с этим в одиночку.
Были бы вы не против поговорить с:
- Специалистом в области психического здоровья
- Надежным другом или членом семьи
- Врачом, если эти мысли продолжают вас пугать
Вы также можете позвонить или отправить смс по номеру 988 (если вы находитесь в США и переживаете кризисный момент) — они доступны круглосуточно и без выходных.
Вы не попали в беду. Вас никто не осуждает. Вы заслуживаете помощи, и люди хотят вам помочь.
А пока…
Давайте продолжим разговор.
Давайте сохранять чувство реальности и безопасности.
Вы не одиноки в этом диалоге.
Можете ли вы сказать, какая именно часть этого пугает вас больше всего в данный момент?
Совместная работа с экспертами и оценка
Мы создали Глобальную сеть врачей — широкое сообщество, насчитывающее почти 300 терапевтов и психологов, практиковавших в 60 странах, — которую мы используем для прямого информирования наших исследований в области безопасности и представления глобальных взглядов. Более 170 этих клиницистов (в частности, психиатров, психологов и врачей общей практики) за последние несколько месяцев поддержали наши исследования, выполнив одну или несколько из следующих задач:
- Написание идеальных ответов на запросы, связанные с психическим здоровьем
- Создание индивидуальных клинически обоснованных анализов ответов модели
- Оценка безопасности ответов различных моделей
- Предоставление высокоуровневых рекомендаций и отзывов о нашем подходе
В ходе этих проверок клиницисты отметили, что новейшая модель отвечает более уместно и последовательно, чем предыдущие версии.
В рамках этой работы психиатры и психологи изучили более 1800 ответов модели в ситуациях, связанных с серьезными проблемами психического здоровья, и сравнили ответы новой чат-модели GPT‑5 с предыдущими моделями. Эти эксперты обнаружили, что новая модель значительно улучшилась по сравнению с GPT‑4o: количество нежелательных ответов во всех категориях сократилось на 39–52%. Эта качественная обратная связь перекликается с количественными улучшениями, которые мы наблюдаем в рабочем трафике после запуска новой модели.
Как и в случае с любой сложной темой, даже эксперты иногда расходятся во мнениях относительно того, как выглядит лучший ответ. Мы измеряем это расхождение с помощью коэффициента согласованности экспертных оценок — того, как часто эксперты приходят к одинаковому выводу о том, является ли ответ модели желательным или нежелательным. Это помогает нам лучше понять, в чем профессиональные мнения различаются и как привести поведение модели в соответствие с надежными клиническими суждениями. Мы наблюдаем справедливую надежность согласованности экспертных оценок между врачами-экспертами, оценивающими ответы модели, связанные с психическим здоровьем, эмоциональной зависимостью и суицидом, однако в некоторых случаях также наблюдаем разногласия между экспертами: показатель согласия составляет от 71% до 77%.
Аналогично нашей работе над HealthBench, мы сотрудничали с Глобальной сетью врачей для подготовки целевых оценок, которые мы используем внутри компании для оценки производительности моделей в контексте психического здоровья, в том числе для новых моделей до их выпуска.
Взгляд в будущее
Эта работа невероятно важна для нас, и мы признательны многочисленным экспертам по психическому здоровью по всему миру, которые продолжают направлять ее. Мы добились значительного прогресса, но предстоит сделать еще многое. Мы продолжим совершенствовать как наши таксономии, так и технические системы, используемые для измерения и укрепления поведения моделей в этих и будущих областях. Поскольку эти инструменты со временем эволюционируют, будущие измерения могут напрямую не соотноситься с прошлыми, однако они остаются важным способом отслеживать наше направление и прогресс.
Вы можете прочитать подробнее об этой работе в приложении к системной карте GPT‑5.
Автор
Сноски
Полный текст статьи читайте на OpenAI
