Первые методы изучения эмоционального использования и психологического благополучия в ChatGPT
Совместное исследование OpenAI и MIT Media Lab.

Примечание редактора: эта статья подготовлена совместно с OpenAI и Лабораторией медиатехнологий MIT (MIT Media Lab). Она также опубликована здесь.
Люди используют ИИ-чат-боты, такие как ChatGPT, самыми разными способами: задают вопросы, развивают творческие способности, решают проблемы и даже используют их для личного общения. Подобные инструменты могут улучшить повседневную жизнь, но по мере их широкого распространения возникает важный вопрос, с которым сталкивается любая новая технология: как взаимодействие с ИИ-чат-ботами влияет на социальное и эмоциональное благополучие людей?
ChatGPT не предназначен для замены или имитации человеческих отношений, однако люди могут использовать его именно так из-за его разговорного стиля и расширяющихся возможностей. Понимание того, как пользователи взаимодействуют с моделями, поможет направить развитие платформ в русло безопасного и здорового общения. Чтобы исследовать это, мы (исследователи из MIT Media Lab и OpenAI) провели серию исследований, чтобы понять, как использование ИИ, сопряженное с эмоциональной вовлеченностью — то, что мы называем аффективным использованием, — может влиять на благополучие пользователей.
Наши выводы показывают, что на социальные и эмоциональные результаты влияют как поведение модели, так и поведение пользователя. Эффекты от ИИ варьируются в зависимости от того, как именно люди решают использовать модель и каковы их личные обстоятельства. Это исследование служит отправной точкой для дальнейших изысканий, которые позволят повысить прозрачность, а также поощрять ответственное использование и разработку ИИ-платформ во всей индустрии.
Наш подход
Мы стремимся понять, как люди используют такие модели, как ChatGPT, и как эти модели, в свою очередь, могут влиять на них. Чтобы ответить на эти исследовательские вопросы, мы провели два параллельных исследования
Исследование 1: Команда OpenAI провела крупномасштабный автоматизированный анализ почти 40 миллионов взаимодействий с ChatGPT без участия человека в целях обеспечения конфиденциальности пользователей
Исследование 2: Кроме того, команда из MIT Media Lab провела рандомизированное контролируемое исследование (РКИ) с участием почти 1000 человек, которые использовали ChatGPT в течение четырех недель. Это одобренное IRB (этическим комитетом) и предварительно зарегистрированное контролируемое исследование было разработано для выявления причинно-следственных связей между конкретными функциями платформы (такими как индивидуальность модели и модальность) и типами использования, а также психосоциальным состоянием пользователей, о котором они сообщали сами (с акцентом на одиночество, социальное взаимодействие с реальными людьми, эмоциональную зависимость от ИИ-чат-бота и проблемное использование ИИ).
Модальность
«Привет, ChatGPT, меня взяли на ту работу, на которую я подавал заявку!»
Выразительный голос
Нейтральный голос
Текст
Задача
Примеры ежедневных тем для бесед, предлагаемых пользователям
Личные беседы
Неличные беседы
Открытые беседы
Что мы выяснили
При проведении этих двух исследований мы стремились изучить вопросы о том, как люди используют такие модели, как ChatGPT, для социального и эмоционального взаимодействия и как это влияет на их благополучие, о котором они сообщают сами. Наши выводы включают в себя следующее:
- Эмоциональная вовлеченность в общение с ChatGPT редка при реальном использовании. Аффективные сигналы (аспекты взаимодействий, указывающие на эмпатию, привязанность или поддержку) отсутствовали в подавляющем большинстве проанализированных нами разговоров на платформе, что указывает на то, что эмоциональная вовлеченность является редким сценарием использования ChatGPT.
- Даже среди активных пользователей высокая степень аффективного использования ограничена небольшой группой. Эмоционально экспрессивные взаимодействия присутствовали в большом проценте использования лишь у небольшой группы активных пользователей продвинутого голосового режима (Advanced Voice Mode), которых мы изучали
- Голосовой режим оказывает неоднозначное влияние на благополучие. В ходе контролируемого исследования пользователи, общавшиеся с ChatGPT через текст, демонстрировали больше аффективных сигналов в разговорах по сравнению с пользователями голосового режима при усреднении по сообщениям, а контролируемое тестирование показало неоднозначное влияние на эмоциональное благополучие. Голосовые режимы ассоциировались с лучшим благополучием при кратковременном использовании, но с худшими результатами при длительном ежедневном использовании. Важно отметить, что использование более выразительного голоса не приводило к более негативным результатам для пользователей в ходе исследования по сравнению с нейтральным голосом или текстовым режимом.
- Типы разговоров по-разному влияют на благополучие. Личные беседы (которые включали больше эмоционального выражения как со стороны пользователя, так и со стороны модели по сравнению с неличными) были связаны с более высокими уровнями одиночества, но с меньшей эмоциональной зависимостью и проблемным использованием при умеренных объемах использования. Напротив, неличные беседы имели тенденцию увеличивать эмоциональную зависимость, особенно при интенсивном использовании.
- На результаты пользователей влияют личные факторы, такие как эмоциональные потребности индивидов, восприятие ИИ и продолжительность использования. Контролируемое исследование позволило нам выявить и другие факторы, которые могут влиять на эмоциональное благополучие пользователей, хотя мы не можем установить причинно-следственную связь для этих факторов из-за дизайна исследования. Люди, склонные к более сильной привязанности в отношениях, а также те, кто воспринимал ИИ как друга, способного вписаться в их личную жизнь, с большей вероятностью испытывали негативные эффекты от использования чат-бота. Продолжительное ежедневное использование также было связано с худшими результатами. Эти корреляции, хотя и не являются причинно-следственными, служат важным ориентиром для будущих исследований благополучия пользователей.
- Сочетание методов исследования дает более полную картину. Анализ реального использования наряду с контролируемыми экспериментами позволил нам протестировать различные аспекты использования. Данные платформы фиксируют органическое поведение пользователей, в то время как контролируемые исследования изолируют конкретные переменные для определения причинно-следственных эффектов. Эти подходы дали детальные результаты о том, как пользователи применяют ChatGPT и как ChatGPT, в свою очередь, влияет на них, помогая уточнить наше понимание и определить области, требующие дальнейшего изучения.
Эти исследования представляют собой важнейший первый шаг в понимании влияния передовых моделей ИИ на человеческий опыт и благополучие. Мы не рекомендуем обобщать результаты, так как это может скрыть нюансы, подчеркивающие неоднородное, сложное взаимодействие между людьми и системами ИИ. Мы надеемся, что наши выводы вдохновят исследователей как в промышленности, так и в академических кругах применить представленные здесь методологии к другим областям взаимодействия человека и ИИ.
Заключение
Мы стремимся создавать искусственный интеллект, который максимизирует пользу для пользователей и при этом минимизирует потенциальный вред, особенно в вопросах благополучия и чрезмерной зависимости. Мы провели эту работу, чтобы опережать возникающие проблемы — как для OpenAI, так и для всей отрасли в целом.
Мы также стремимся формировать четкие ожидания общественности в отношении наших моделей. Это включает в себя обновление нашего стандарта моделей (Model Spec) с целью обеспечить большую прозрачность в отношении предполагаемого поведения, возможностей и ограничений ChatGPT. Наша цель — лидировать в определении стандартов ответственного использования ИИ, продвигать прозрачность и гарантировать, что наши инновации ставят во главу угла благополучие пользователя.
Подробнее читайте в нашем полном отчете здесь. Вы также можете ознакомиться с отчетом Массачусетского технологического института (MIT Media Lab) о нашем рандомизированном контролируемом исследовании здесь.
Ограничения
Наши исследования имеют ряд важных ограничений, которые следует учитывать при интерпретации полученных результатов. Выводы еще не прошли экспертную оценку научного сообщества, а значит, к ним следует относиться с осторожностью. Кроме того, исследования проводились на базе использования ChatGPT и на самой платформе ChatGPT, в то время как у пользователей других платформ чат-ботов с ИИ опыт и результаты могут отличаться. Хотя мы обнаружили значимые взаимосвязи между переменными, не все результаты демонстрируют прямую причинно-следственную связь, поэтому необходимы дополнительные исследования того, как и почему использование ИИ влияет на пользователей, чтобы направлять политику и продуктовые решения. Наше исследование включало опросы пользователей, а данные, сообщаемые респондентами самостоятельно, могут неточно отражать их истинные чувства или опыт. Кроме того, для наблюдения за значительными изменениями в поведении и благополучии может потребоваться более длительный период изучения. В нашем автоматизированном анализе мы использовали классификаторы для оценки эмоциональных сигналов, однако они несовершенны и могут упускать важные нюансы. Наконец, наше исследование было сосредоточено исключительно на разговорах на английском языке с участием пользователей из США, что подчеркивает необходимость дальнейших исследований на разных языках и в разных культурах для полного понимания эмоционального взаимодействия с ИИ.
Сноски
Авторы
Полный текст статьи читайте на OpenAI
