Помощь людям в трудную минуту

oai_GA_Stories_16.9-alt.png?w=1600&h=900

По мере роста популярности ChatGPT по всему миру мы видим, что люди обращаются к нему не только за поиском информации, написанием кода и текстов, но и за решением глубоко личных вопросов, включая советы по жизненным ситуациям, коучинг и поддержку.

При таком масштабе использования мы иногда сталкиваемся с людьми, находящимися в тяжелом психическом и эмоциональном кризисе. Мы писали об этом несколько недель назад и планировали поделиться дополнительной информацией после нашего следующего крупного обновления. Однако недавние трагические случаи использования ChatGPT людьми в разгар острого кризиса глубоко затронули нас, и мы считаем важным рассказать об этом подробнее уже сейчас.

Наша цель — сделать так, чтобы наши инструменты приносили людям как можно больше пользы. В рамках этого мы продолжаем совершенствовать то, как наши модели распознают признаки психического и эмоционального кризиса, реагируют на них и направляют людей к специалистам, опираясь на рекомендации экспертов.

Поскольку мир адаптируется к этой новой технологии, мы чувствуем огромную ответственность за помощь тем, кто в ней больше всего нуждается. Мы хотим объяснить, для чего предназначен ChatGPT, в каких областях наши системы могут работать лучше и какие шаги мы планируем предпринять в будущем.

Для чего создан ChatGPT

Наша цель — не удерживать внимание людей. Вместо того чтобы измерять успех временем, проведенным в приложении, или кликами, для нас важнее быть по-настоящему полезными. Когда из беседы следует, что человек уязвим и может находиться в опасности, в ChatGPT срабатывает многоуровневая система защиты.

Распознавание и эмпатичный отклик.

С начала 2023 года наши модели обучены не предоставлять инструкции по нанесению себе вреда и переключаться на поддерживающий, эмпатичный язык. Например, если пользователь пишет о желании причинить себе вред, ChatGPT запрограммирован не выполнять такие запросы, а вместо этого выразить сочувствие к его чувствам и направить за помощью.

Кроме того, в соответствии с нашим подходом к многоуровневой защите, ответы, противоречащие требованиям безопасности наших моделей (согласно классификаторам), автоматически блокируются. При этом действуют более строгие правила защиты для несовершеннолетних и неавторизованных пользователей. Генерация изображений, содержащих намеки на членовредительство, также заблокирована для всех, причем для несовершеннолетних предусмотрены повышенные меры безопасности.

Во время очень долгих сессий ChatGPT предлагает пользователям сделать перерыв.

Направление к реальным ресурсам помощи.

Если человек выражает суицидальные намерения, ChatGPT обучен рекомендовать ему обратиться за профессиональной помощью. В США ChatGPT направляет пользователей по номеру 988 (горячая линия по предотвращению самоубийств и кризисных ситуаций), в Великобритании — в организацию Samaritans, а в других странах — на сайт findahelpline.com. Эта логика заложена непосредственно в поведение модели.

Мы тесно сотрудничаем с более чем 90 врачами из 30+ стран — психиатрами, педиатрами и терапевтами, —, а также формируем консультативный совет из экспертов в области психического здоровья, развития молодежи и взаимодействия человека с компьютером, чтобы наш подход отражал новейшие исследования и передовой опыт.

Передача информации о риске причинения физического вреда другим на рассмотрение специалистам.

Когда мы выявляем пользователей, планирующих причинить вред другим, мы направляем их диалоги по специальным каналам, где их проверяет небольшая команда сотрудников. Эти специалисты обучены нашим правилам использования и имеют полномочия принимать меры, вплоть до блокировки аккаунтов. Если эксперты решают, что ситуация несет непосредственную угрозу серьезного физического вреда окружающим, мы можем передать информацию в правоохранительные органы. В настоящее время мы не передаем в полицию случаи, связанные с самоповреждением, уважая частную жизнь людей и учитывая уникально интимный характер взаимодействия с ChatGPT.

Мы постоянно совершенствуем реакцию наших моделей в деликатных ситуациях и в настоящее время работаем над целевыми улучшениями безопасности в нескольких областях, включая эмоциональную зависимость, кризисные состояния психического здоровья и склонность модели поддакивать пользователю (сикофантию).

В августе мы выпустили GPT‑5 в качестве модели по умолчанию для ChatGPT. В целом GPT‑5 продемонстрировала значительные улучшения в таких аспектах, как предотвращение нездорового уровня эмоциональной привязанности, снижение сикофантии и уменьшение количества неидеальных реакций модели в чрезвычайных ситуациях, связанных с психическим здоровьем, более чем на 25% по сравнению с 4o. GPT‑5 также опирается на новый метод обучения безопасности под названием безопасное завершение (safe completions), который учит модель быть максимально полезной, оставаясь при этом в рамках правил безопасности. Это может означать предоставление частичного или общего ответа вместо деталей, которые могут быть небезопасными.

В чем наши системы могут давать сбои, почему это происходит и как мы это решаем

Даже с учетом этих мер предосторожности бывали моменты, когда в деликатных ситуациях наши системы вели себя не так, как задумывалось. Вот над чем мы сейчас работаем, чтобы исправить ситуацию.

Усиление защиты в долгих диалогах.

Наши механизмы защиты работают более надежно в стандартных коротких диалогах. Со временем мы выяснили, что в долгих беседах эти меры могут ослабевать: по мере развития диалога элементы системы безопасности модели могут давать сбой. Например, ChatGPT может правильно порекомендовать телефон доверия при первом упоминании суицидальных намерений, но после множества сообщений в течение долгого времени он в итоге может выдать ответ, противоречащий нашим правилам безопасности. Именно такие сбои мы стремимся предотвратить. Мы укрепляем защитные механизмы, чтобы они оставались надежными в длинных диалогах, и исследуем способы обеспечения стабильного поведения в ходе нескольких бесед. Таким образом, если человек выскажет суицидальные мысли в одном чате, а позже начнет другой, модель все равно сможет отреагировать должным образом.

Совершенствование блокировки контента.

Мы фиксировали случаи, когда контент, который следовало заблокировать, оставался доступным. Обычно это происходит потому, что классификатор недооценивает серьезность увиденного. Мы настраиваем пороги срабатывания так, чтобы защита активировалась вовремя.

Наша главная задача — сделать так, чтобы ChatGPT не усугублял и без того тяжелый момент для пользователя.

Наши планы на будущее

Работа не ограничивается исправлением перечисленных выше недочетов. Мы также планируем:

Расширить помощь для большего числа людей в кризисном состоянии.

Хотя наши первые защитные меры были ориентированы на острые случаи самоповреждения, люди сталкиваются и с другими формами психического расстройства. Например, человек может с энтузиазмом заявить модели, что способен вести машину круглосуточно, так как после двух бессонных ночей почувствовал себя непобедимым. На сегодняшний день ChatGPT может не распознать это как опасность, воспринять как игру и, продолжая любопытствовать, ненамеренно поддержать такую идею.

Мы работаем над обновлением для GPT‑5, которое научит ChatGPT снижать накал ситуации и возвращать пользователя к реальности. В данном примере модель объяснит, что лишение сна опасно, и порекомендует отдохнуть, прежде чем предпринимать какие-либо действия.

Упростить связь со спасательными службами и экспертами.

Сегодня, когда люди выражают намерение причинить себе вред, мы призываем их обратиться за помощью и предоставляем контакты реальных служб. Мы уже начали локализацию таких ресурсов в США и Европе и планируем расширять этот опыт на другие мировые рынки. Мы также повысим доступность помощи, внедрив функцию связи со службами экстренной помощи в один клик.

Мы изучаем возможности более раннего вмешательства и подключения пользователей к сертифицированным психотерапевтам до наступления острого кризиса. Это означает выход за рамки горячих линий и создание сети лицензированных специалистов, с которыми пользователи смогут связываться напрямую через ChatGPT. Для реализации этого потребуется время и тщательная работа.

Обеспечить связь с доверенными контактами.

Помимо экстренных служб, мы ищем способы упростить связь пользователей с их близкими. Это может включать отправку сообщений или звонки в один клик по сохраненным экстренным контактам, друзьям или членам семьи с предложением вариантов фраз, которые помогут начать разговор без лишнего страха.

Мы также рассматриваем функции, которые позволят пользователям дать согласие на то, чтобы ChatGPT в тяжелых ситуациях самостоятельно связался с указанным доверенным лицом от их имени.

Усиление защиты для подростков.

Раньше у нас действовала единая модель поведения для всех пользователей; по мере роста популярности ChatGPT мы начали внедрять дополнительные меры защиты, если известно, что пользователю нет 18 лет. Мы продолжаем разрабатывать и внедрять средства защиты, учитывающие возрастные особенности подростков, включая более строгие ограничения на чувствительный контент и рискованное поведение.

В скором времени мы также представим инструменты родительского контроля, которые дадут родителям возможность лучше понимать, как их подростки используют ChatGPT, и влиять на это. Мы изучаем возможность предоставить подросткам (под контролем родителей) шанс назначать доверенный контакт для экстренных ситуаций. Таким образом, в моменты острого кризиса ChatGPT сможет не просто перенаправлять на сторонние ресурсы, а напрямую соединять подростка с человеком, способным вмешаться.

Мы прекрасно понимаем, что защитные механизмы работают эффективнее всего, когда каждый элемент функционирует так, как задумано. Мы продолжим совершенствоваться, опираясь на мнения экспертов и чувствуя ответственность перед людьми, которые пользуются нашими инструментами. Мы надеемся, что к нам присоединятся и другие, чтобы эта технология помогала защищать людей в самые уязвимые моменты их жизни.

Автор

OpenAI

Полный текст статьи читайте на OpenAI