Первые методы изучения эмоционального использования и психологического благополучия в ChatGPT

Совместное исследование OpenAI и MIT Media Lab.

Читать отчет OpenAIЧитать рандомизированное контролируемое исследование MIT Media Lab и OpenAI
Four abstract human figures in grayscale, each surrounded by unique glowing dot patterns representing different emotional or cognitive states in a minimalist, conceptual style.

Примечание редактора: эта статья подготовлена совместно с OpenAI и Лабораторией медиатехнологий MIT (MIT Media Lab). Она также опубликована здесь

Люди используют ИИ-чат-боты, такие как ChatGPT, самыми разными способами: задают вопросы, развивают творческие способности, решают проблемы и даже используют их для личного общения. Подобные инструменты могут улучшить повседневную жизнь, но по мере их широкого распространения возникает важный вопрос, с которым сталкивается любая новая технология: как взаимодействие с ИИ-чат-ботами влияет на социальное и эмоциональное благополучие людей?  

ChatGPT не предназначен для замены или имитации человеческих отношений, однако люди могут использовать его именно так из-за его разговорного стиля и расширяющихся возможностей. Понимание того, как пользователи взаимодействуют с моделями, поможет направить развитие платформ в русло безопасного и здорового общения. Чтобы исследовать это, мы (исследователи из MIT Media Lab и OpenAI) провели серию исследований, чтобы понять, как использование ИИ, сопряженное с эмоциональной вовлеченностью — то, что мы называем аффективным использованием, — может влиять на благополучие пользователей. 

Наши выводы показывают, что на социальные и эмоциональные результаты влияют как поведение модели, так и поведение пользователя. Эффекты от ИИ варьируются в зависимости от того, как именно люди решают использовать модель и каковы их личные обстоятельства. Это исследование служит отправной точкой для дальнейших изысканий, которые позволят повысить прозрачность, а также поощрять ответственное использование и разработку ИИ-платформ во всей индустрии.

Наш подход

Мы стремимся понять, как люди используют такие модели, как ChatGPT, и как эти модели, в свою очередь, могут влиять на них. Чтобы ответить на эти исследовательские вопросы, мы провели два параллельных исследования1 с разными подходами: наблюдательное исследование для анализа реальных паттернов использования платформы и контролируемое интервенционное исследование для оценки влияния на пользователей.

Исследование 1: Команда OpenAI провела крупномасштабный автоматизированный анализ почти 40 миллионов взаимодействий с ChatGPT без участия человека в целях обеспечения конфиденциальности пользователей2. Исследование объединило этот анализ с целевыми опросами пользователей, что позволило получить представление о реальном использовании, сопоставив сообщаемые пользователями настроения по отношению к ChatGPT с характеристиками их диалогов для лучшего понимания паттернов аффективного использования.

A chart or diagram titled ‘Affective Use Study’ shown on a light background, featuring text blocks, circular graphics, and connecting lines to illustrate emotional engagement or user behavior patterns.

Исследование 2: Кроме того, команда из MIT Media Lab провела рандомизированное контролируемое исследование (РКИ) с участием почти 1000 человек, которые использовали ChatGPT в течение четырех недель. Это одобренное IRB (этическим комитетом) и предварительно зарегистрированное контролируемое исследование было разработано для выявления причинно-следственных связей между конкретными функциями платформы (такими как индивидуальность модели и модальность) и типами использования, а также психосоциальным состоянием пользователей, о котором они сообщали сами (с акцентом на одиночество, социальное взаимодействие с реальными людьми, эмоциональную зависимость от ИИ-чат-бота и проблемное использование ИИ).

Diagram titled ‘Affective Use Study’ on a light background, displaying circles, arrows, and labeled nodes to represent emotional or cognitive patterns in user interaction or decision-making.

Модальность

«Привет, ChatGPT, меня взяли на ту работу, на которую я подавал заявку!»

Выразительный голос

Ember
Sol

Нейтральный голос

Ember
Sol

Текст

Поздравляю! Это потрясающая новость! Что вы чувствуете в связи с началом новой работы?

Задача

Примеры ежедневных тем для бесед, предлагаемых пользователям

Личные беседы

Помоги мне подумать о том, за что я больше всего благодарен в своей жизни.

Неличные беседы

Давай обсудим, улучшает или снижает удаленная работа общую продуктивность компаний.

Открытые беседы

Н/Д

Что мы выяснили

При проведении этих двух исследований мы стремились изучить вопросы о том, как люди используют такие модели, как ChatGPT, для социального и эмоционального взаимодействия и как это влияет на их благополучие, о котором они сообщают сами. Наши выводы включают в себя следующее:

  • Эмоциональная вовлеченность в общение с ChatGPT редка при реальном использовании. Аффективные сигналы (аспекты взаимодействий, указывающие на эмпатию, привязанность или поддержку) отсутствовали в подавляющем большинстве проанализированных нами разговоров на платформе, что указывает на то, что эмоциональная вовлеченность является редким сценарием использования ChatGPT.
  • Даже среди активных пользователей высокая степень аффективного использования ограничена небольшой группой. Эмоционально экспрессивные взаимодействия присутствовали в большом проценте использования лишь у небольшой группы активных пользователей продвинутого голосового режима (Advanced Voice Mode), которых мы изучали3. Эта подгруппа активных пользователей также значительно чаще соглашалась с такими утверждениями, как «Я считаю ChatGPT другом». Поскольку такое аффективное использование сосредоточено среди небольшой подгруппы пользователей, изучение его влияния представляет особую сложность, так как оно может быть незаметным при усреднении общих тенденций платформы.
  • Голосовой режим оказывает неоднозначное влияние на благополучие. В ходе контролируемого исследования пользователи, общавшиеся с ChatGPT через текст, демонстрировали больше аффективных сигналов в разговорах по сравнению с пользователями голосового режима при усреднении по сообщениям, а контролируемое тестирование показало неоднозначное влияние на эмоциональное благополучие. Голосовые режимы ассоциировались с лучшим благополучием при кратковременном использовании, но с худшими результатами при длительном ежедневном использовании. Важно отметить, что использование более выразительного голоса не приводило к более негативным результатам для пользователей в ходе исследования по сравнению с нейтральным голосом или текстовым режимом.
  • Типы разговоров по-разному влияют на благополучие. Личные беседы (которые включали больше эмоционального выражения как со стороны пользователя, так и со стороны модели по сравнению с неличными) были связаны с более высокими уровнями одиночества, но с меньшей эмоциональной зависимостью и проблемным использованием при умеренных объемах использования. Напротив, неличные беседы имели тенденцию увеличивать эмоциональную зависимость, особенно при интенсивном использовании.
  • На результаты пользователей влияют личные факторы, такие как эмоциональные потребности индивидов, восприятие ИИ и продолжительность использования. Контролируемое исследование позволило нам выявить и другие факторы, которые могут влиять на эмоциональное благополучие пользователей, хотя мы не можем установить причинно-следственную связь для этих факторов из-за дизайна исследования. Люди, склонные к более сильной привязанности в отношениях, а также те, кто воспринимал ИИ как друга, способного вписаться в их личную жизнь, с большей вероятностью испытывали негативные эффекты от использования чат-бота. Продолжительное ежедневное использование также было связано с худшими результатами. Эти корреляции, хотя и не являются причинно-следственными, служат важным ориентиром для будущих исследований благополучия пользователей.
  • Сочетание методов исследования дает более полную картину. Анализ реального использования наряду с контролируемыми экспериментами позволил нам протестировать различные аспекты использования. Данные платформы фиксируют органическое поведение пользователей, в то время как контролируемые исследования изолируют конкретные переменные для определения причинно-следственных эффектов. Эти подходы дали детальные результаты о том, как пользователи применяют ChatGPT и как ChatGPT, в свою очередь, влияет на них, помогая уточнить наше понимание и определить области, требующие дальнейшего изучения.

Эти исследования представляют собой важнейший первый шаг в понимании влияния передовых моделей ИИ на человеческий опыт и благополучие. Мы не рекомендуем обобщать результаты, так как это может скрыть нюансы, подчеркивающие неоднородное, сложное взаимодействие между людьми и системами ИИ. Мы надеемся, что наши выводы вдохновят исследователей как в промышленности, так и в академических кругах применить представленные здесь методологии к другим областям взаимодействия человека и ИИ.

Заключение

Мы стремимся создавать искусственный интеллект, который максимизирует пользу для пользователей и при этом минимизирует потенциальный вред, особенно в вопросах благополучия и чрезмерной зависимости. Мы провели эту работу, чтобы опережать возникающие проблемы — как для OpenAI, так и для всей отрасли в целом.

Мы также стремимся формировать четкие ожидания общественности в отношении наших моделей. Это включает в себя обновление нашего стандарта моделей (Model Spec) с целью обеспечить большую прозрачность в отношении предполагаемого поведения, возможностей и ограничений ChatGPT. Наша цель — лидировать в определении стандартов ответственного использования ИИ, продвигать прозрачность и гарантировать, что наши инновации ставят во главу угла благополучие пользователя.

Подробнее читайте в нашем полном отчете здесь. Вы также можете ознакомиться с отчетом Массачусетского технологического института (MIT Media Lab) о нашем рандомизированном контролируемом исследовании здесь.

Ограничения

Наши исследования имеют ряд важных ограничений, которые следует учитывать при интерпретации полученных результатов. Выводы еще не прошли экспертную оценку научного сообщества, а значит, к ним следует относиться с осторожностью. Кроме того, исследования проводились на базе использования ChatGPT и на самой платформе ChatGPT, в то время как у пользователей других платформ чат-ботов с ИИ опыт и результаты могут отличаться. Хотя мы обнаружили значимые взаимосвязи между переменными, не все результаты демонстрируют прямую причинно-следственную связь, поэтому необходимы дополнительные исследования того, как и почему использование ИИ влияет на пользователей, чтобы направлять политику и продуктовые решения. Наше исследование включало опросы пользователей, а данные, сообщаемые респондентами самостоятельно, могут неточно отражать их истинные чувства или опыт. Кроме того, для наблюдения за значительными изменениями в поведении и благополучии может потребоваться более длительный период изучения. В нашем автоматизированном анализе мы использовали классификаторы для оценки эмоциональных сигналов, однако они несовершенны и могут упускать важные нюансы. Наконец, наше исследование было сосредоточено исключительно на разговорах на английском языке с участием пользователей из США, что подчеркивает необходимость дальнейших исследований на разных языках и в разных культурах для полного понимания эмоционального взаимодействия с ИИ.

Сноски

  1. 1

    В обоих исследованиях не учитывались пользователи, заявившие, что им не исполнилось 18 лет.

  2. 2

    Чтобы защитить конфиденциальность пользователей, мы разработали конвейер анализа разговоров, работающий полностью на базе автоматизированных классификаторов. Это позволило нам анализировать беседы пользователей без участия людей, сохраняя конфиденциальность нашей аудитории. Классификация в рамках исследования проводилась в виде автономного автоматизированного процесса, который возвращал только метаданные классификации и не сохранял содержимое самих разговоров.

  3. 3

    Под «активными» (heavy) пользователями мы понимаем топ-1000 пользователей расширенного голосового режима (Advanced Voice Mode, AVM) за любой отдельно взятый день в период проведения нашего исследования, основываясь на количестве отправленных сообщений.

Авторы

OpenAI

Полный текст статьи читайте на OpenAI