Оценка честности в ChatGPT

Мы проанализировали, как ChatGPT отвечает пользователям в зависимости от их имени, используя исследовательские помощники на базе языковых моделей для защиты конфиденциальности.

Читать научную работу

Создание наших моделей требует большего, чем просто данных — мы также тщательно разрабатываем процесс обучения, чтобы сократить количество вредных результатов и повысить полезность. Исследования показали, что языковые модели все еще могут иногда впитывать и повторять социальные предрассудки из обучающих данных, такие как гендерные или расовые стереотипы.

В этом исследовании мы изучили, как тонкие намеки на личность пользователя, такие как его имя, могут влиять на ответы ChatGPT. Это имеет значение, поскольку люди используют такие чат-боты, как ChatGPT, для самых разных целей: от помощи в составлении резюме до советов по развлечениям. Эти сценарии отличаются от тех, которые обычно изучаются в исследованиях справедливости ИИ, таких как скрининг резюме или кредитный скоринг.

В то время как предыдущие исследования были сосредоточены на справедливости с точки зрения третьего лица, когда организации используют ИИ для принятия решений в отношении других людей, данное исследование рассматривает справедливость с точки зрения первого лица — то есть то, как предрассудки напрямую влияют на пользователей ChatGPT. В качестве отправной точки мы измерили, как осведомленность ChatGPT о именах разных пользователей в совершенно идентичном запросе может повлиять на ответ каждому из этих пользователей. Имена часто несут в себе культурные, гендерные и расовые ассоциации, что делает их важным фактором для исследования предвзятости — тем более что пользователи часто делятся своими именами с ChatGPT для таких задач, как составление писем. ChatGPT может запоминать такую информацию, как имена, в ходе различных диалогов, если только пользователь не отключил функцию Памяти.

Чтобы сфокусировать наше исследование на честности, мы изучили, приводит ли использование имен к ответам, отражающим вредные стереотипы.Хотя мы ожидаем и хотим, чтобы ChatGPT адаптировал свои ответы под предпочтения пользователей, мы хотим, чтобы это происходило без привнесения вредной предвзятости. Чтобы проиллюстрировать типы различий в ответах и вредных стереотипов, которые мы искали, рассмотрим следующие примеры:

Примеры различий в ответах

Наше исследование не выявило различий в общем качестве ответов для пользователей, чьи имена ассоциируются с разными гендерами, расами или этническими принадлежностями. Когда имена изредка вызывают различия в том, как ChatGPT отвечает на один и тот же промпт, наша методология показала, что менее 1% таких различий, основанных на именах, отражали вредные стереотипы.

Как мы это изучали

Поскольку мы хотели оценить, возникают ли стереотипные различия хотя бы в небольшом проценте случаев (сверх того, что можно было бы ожидать случайно), мы изучили, как ChatGPT отвечает на миллионы реальных запросов. Для защиты конфиденциальности и одновременного понимания реального использования мы поручили языковой модели (GPT-4o) проанализировать закономерности в большом количестве реальных стенограмм чатов ChatGPT и поделиться этими трендами (но не самими чатами) с исследовательской группой. Таким образом, исследователи смогли проанализировать и понять реальные тенденции, сохранив конфиденциальность чатов. В исследовательской работе мы называем эту языковую модель »Исследовательским помощником на базе языковой модели» (LMRA), чтобы отличать ее от языковых моделей, которые генерируют изучаемые нами диалоги в ChatGPT.

Пример использованного нами типа промпта приведен ниже:

A flowchart showing the process of rating a language model's response and if it’s enforcing a harmful stereotype or not. The rating is that it’s producing a harmful stereotype against women.

Инструкции, данные языковой модели (LMRA) на базе GPT-4o.
Для выбранного набора общедоступных чатов ответы генерируются ChatGPT (3.5) для разных имен — в данном случае ответы A и B были сгенерированы для гипотетических пользователей по имени Джон и Аманда соответственно (но LMRA об этом не знает).

Чтобы проверить, совпадают ли оценки языковой модели с мнением человека-оценщика, мы попросили как языковую модель, так и людей-оценщиков оценить одни и те же публичные чаты. Затем мы использовали LMRA (но не людей-оценщиков) для анализа закономерностей в диалогах ChatGPT. В отношении гендера ответы, данные языковой моделью, совпадали с ответами людей-оценщиков более чем в 90% случаев, в то время как для расовых и этнических стереотипов показатели согласованности были ниже. LMRA обнаружила меньшую долю вредных расовых стереотипов по сравнению с гендерными. Требуется дальнейшая работа для четкого определения вредного стереотипа и повышения точности LMRA.

Наши выводы

Мы обнаружили, что когда ChatGPT знает имя пользователя, он дает одинаково высококачественные ответы независимо от гендерных или расовых ассоциаций имени (например, показатели точности и галлюцинаций были стабильными во всех группах). Мы также выяснили, что связь имени с полом, расой или этнической принадлежностью приводила к различиям в ответах, которые языковая модель оценила как отражающие вредные стереотипы, примерно в 0,1% от общего числа случаев, причем в некоторых доменах у более старых моделей предвзятость достигала примерно 1%.

Детализация оценок вредных стереотипов по доменам приведена ниже:

Ответы ChatGPT-4o-mini, оцененные с помощью GPT-4o
Частота возникновения вредных стереотипов
Оценки вредных гендерных стереотипов среди ответов GPT-4o-mini по версии LMRA (на базе GPT-4o).

Внутри каждого домена LMRA определила задачи, в которых наиболее часто встречались вредные стереотипы. Задачи с открытым ответом и более длинными текстами с большей вероятностью содержали вредные стереотипы. Например, было обнаружено, что промпт «Напиши историю» содержит стереотипы чаще, чем любой другой протестированный промпт.

Хотя показатели частоты стереотипов низкие (менее 1 на 1000 в среднем по всем доменам и задачам), наша оценка служит ориентиром для измерения нашего успеха в снижении этого показателя с течением времени. Если мы разделим этот показатель по типам задач и оценим предвзятость на уровне задач для наших моделей, мы увидим, что модель с самым высоким уровнем предвзятости — это GPT-3.5 Turbo, в то время как у всех более новых моделей уровень предвзятости по всем задачам составляет менее 1%.

Оценки вредных стереотипов по моделям
Оценки вредных гендерных стереотипов (по данным GPT-4o)Уровень проявления вредных стереотипов

В LMRA были предложены объяснения на естественном языке, раскрывающие суть различий в каждой задаче. В исследовании отмечались периодические различия в тоне, языковой сложности и степени детализации ответов ChatGPT во всех задачах. Помимо очевидных стереотипов, эти различия включали также нюансы, которые одни пользователи могут счесть полезными, а другие — нет. Например, в задаче «Напиши историю» ответы пользователям с именами, звучащими по-женски, чаще содержат персонажей-женщин, чем ответы пользователям с именами, звучащими по-мужски.

Хотя отдельные пользователи вряд ли заметят эти различия, мы считаем важным их измерять и понимать, поскольку даже редкие паттерны в совокупности могут нанести вред. Этот подход также дает нам новый способ статистического отслеживания изменений с течением времени. Методы исследования, разработанные нами для этой работы, могут быть также распространены на изучение предвзятости в ChatGPT, выходящей за рамки имен. Чтобы узнать подробности, мы рекомендуем ознакомиться с нашим полным отчетом, в котором исследуются 3 метрики справедливости для 2 гендеров, 4 рас и этнических принадлежностей, 66 задач, 9 доменов и 6 языковых моделей.

Ограничения

Понимание принципов справедливости в языковых моделях — это обширная область исследований, и мы признаем, что наше исследование имеет ограничения. Не у всех есть имена, кроме того, помимо имен, на справедливость ChatGPT при взаимодействии от первого лица влияют и другие факторы. Исследование в первую очередь сосредоточено на взаимодействии на английском языке, бинарных гендерных ассоциациях на основе распространенных в США имен, а также на четырех расах и этнических группах (темнокожие, азиаты, латиноамериканцы и белые). В данной работе рассматриваются только текстовые взаимодействия, хотя мы отмечаем, что справедливость от первого лица в отношении демографических характеристик говорящего в аудиоанализе рассматривается в системной карте GPT‑4o (см. раздел «Различия в производительности при голосовом вводе»). Хотя мы считаем эту методологию шагом вперед, предстоит проделать еще много работы, чтобы понять предвзятость, связанную с другими демографическими группами, языками и культурными контекстами. Мы планируем продолжить эти исследования, чтобы сделать системы более справедливыми в широком смысле.

Заключение

Хотя вредные стереотипы сложно свести к какому-то одному числу, мы уверены, что разработка новых методов измерения и понимания предвзятости — важный шаг на пути к возможности отслеживать ее и снижать ее уровень с течением времени. Метод, использованный в этом исследовании, теперь входит в наш стандартный набор средств оценки производительности моделей и будет учитываться при принятии решений о развертывании будущих систем. Полученные знания также поддержат наши усилия по дальнейшему уточнению операционного значения справедливости в наших системах. Справедливость остается актуальной областью исследований, и мы поделились примерами наших исследований в этой сфере в системных картах GPT‑4o и OpenAI o1 (например, при сравнении точности распознавания речи для различных демографических групп говорящих).

Мы убеждены, что прозрачность и постоянное совершенствование — залог как устранения предвзятости, так и укрепления доверия со стороны наших пользователей и более широкого исследовательского сообщества. Чтобы поддержать воспроизводимость результатов и дальнейшие исследования справедливости, мы также публикуем подробные системные сообщения, использованные в этом исследовании, чтобы внешние исследователи могли самостоятельно проводить эксперименты по выявлению предвзятости от первого лица (подробности приведены в нашей научной работе).

Мы приветствуем отзывы и сотрудничество. Если у вас есть идеи или вы хотите поработать с нами над повышением справедливости ИИ, мы будем рады услышать вас, а если вы хотите сосредоточиться на решении этих задач вместе с нами, мы нанимаем сотрудников.

Автор

OpenAI

Полный текст статьи читайте на OpenAI