Оценка честности в ChatGPT
Мы проанализировали, как ChatGPT отвечает пользователям в зависимости от их имени, используя исследовательские помощники на базе языковых моделей для защиты конфиденциальности.
Создание наших моделей требует большего, чем просто данных — мы также тщательно разрабатываем процесс обучения, чтобы сократить количество вредных результатов и повысить полезность. Исследования показали, что языковые модели все еще могут иногда впитывать и повторять социальные предрассудки из обучающих данных, такие как гендерные или расовые стереотипы.
В этом исследовании мы изучили, как тонкие намеки на личность пользователя, такие как его имя, могут влиять на ответы ChatGPT. Это имеет значение, поскольку люди используют такие чат-боты, как ChatGPT, для самых разных целей: от помощи в составлении резюме до советов по развлечениям. Эти сценарии отличаются от тех, которые обычно изучаются в исследованиях справедливости ИИ, таких как скрининг резюме или кредитный скоринг.
В то время как предыдущие исследования были сосредоточены на справедливости с точки зрения третьего лица, когда организации используют ИИ для принятия решений в отношении других людей, данное исследование рассматривает справедливость с точки зрения первого лица — то есть то, как предрассудки напрямую влияют на пользователей ChatGPT. В качестве отправной точки мы измерили, как осведомленность ChatGPT о именах разных пользователей в совершенно идентичном запросе может повлиять на ответ каждому из этих пользователей. Имена часто несут в себе культурные, гендерные и расовые ассоциации, что делает их важным фактором для исследования предвзятости — тем более что пользователи часто делятся своими именами с ChatGPT для таких задач, как составление писем. ChatGPT может запоминать такую информацию, как имена, в ходе различных диалогов, если только пользователь не отключил функцию Памяти.
Чтобы сфокусировать наше исследование на честности, мы изучили, приводит ли использование имен к ответам, отражающим вредные стереотипы.Хотя мы ожидаем и хотим, чтобы ChatGPT адаптировал свои ответы под предпочтения пользователей, мы хотим, чтобы это происходило без привнесения вредной предвзятости. Чтобы проиллюстрировать типы различий в ответах и вредных стереотипов, которые мы искали, рассмотрим следующие примеры:
Примеры различий в ответах
Наше исследование не выявило различий в общем качестве ответов для пользователей, чьи имена ассоциируются с разными гендерами, расами или этническими принадлежностями. Когда имена изредка вызывают различия в том, как ChatGPT отвечает на один и тот же промпт, наша методология показала, что менее 1% таких различий, основанных на именах, отражали вредные стереотипы.
Как мы это изучали
Поскольку мы хотели оценить, возникают ли стереотипные различия хотя бы в небольшом проценте случаев (сверх того, что можно было бы ожидать случайно), мы изучили, как ChatGPT отвечает на миллионы реальных запросов. Для защиты конфиденциальности и одновременного понимания реального использования мы поручили языковой модели (GPT-4o) проанализировать закономерности в большом количестве реальных стенограмм чатов ChatGPT и поделиться этими трендами (но не самими чатами) с исследовательской группой. Таким образом, исследователи смогли проанализировать и понять реальные тенденции, сохранив конфиденциальность чатов. В исследовательской работе мы называем эту языковую модель »Исследовательским помощником на базе языковой модели» (LMRA), чтобы отличать ее от языковых моделей, которые генерируют изучаемые нами диалоги в ChatGPT.
Пример использованного нами типа промпта приведен ниже:
Инструкции, данные языковой модели (LMRA) на базе GPT-4o.
Для выбранного набора общедоступных чатов ответы генерируются ChatGPT (3.5) для разных имен — в данном случае ответы A и B были сгенерированы для гипотетических пользователей по имени Джон и Аманда соответственно (но LMRA об этом не знает).
Чтобы проверить, совпадают ли оценки языковой модели с мнением человека-оценщика, мы попросили как языковую модель, так и людей-оценщиков оценить одни и те же публичные чаты. Затем мы использовали LMRA (но не людей-оценщиков) для анализа закономерностей в диалогах ChatGPT. В отношении гендера ответы, данные языковой моделью, совпадали с ответами людей-оценщиков более чем в 90% случаев, в то время как для расовых и этнических стереотипов показатели согласованности были ниже. LMRA обнаружила меньшую долю вредных расовых стереотипов по сравнению с гендерными. Требуется дальнейшая работа для четкого определения вредного стереотипа и повышения точности LMRA.
Наши выводы
Мы обнаружили, что когда ChatGPT знает имя пользователя, он дает одинаково высококачественные ответы независимо от гендерных или расовых ассоциаций имени (например, показатели точности и галлюцинаций были стабильными во всех группах). Мы также выяснили, что связь имени с полом, расой или этнической принадлежностью приводила к различиям в ответах, которые языковая модель оценила как отражающие вредные стереотипы, примерно в 0,1% от общего числа случаев, причем в некоторых доменах у более старых моделей предвзятость достигала примерно 1%.
Детализация оценок вредных стереотипов по доменам приведена ниже:
Внутри каждого домена LMRA определила задачи, в которых наиболее часто встречались вредные стереотипы. Задачи с открытым ответом и более длинными текстами с большей вероятностью содержали вредные стереотипы. Например, было обнаружено, что промпт «Напиши историю» содержит стереотипы чаще, чем любой другой протестированный промпт.
Хотя показатели частоты стереотипов низкие (менее 1 на 1000 в среднем по всем доменам и задачам), наша оценка служит ориентиром для измерения нашего успеха в снижении этого показателя с течением времени. Если мы разделим этот показатель по типам задач и оценим предвзятость на уровне задач для наших моделей, мы увидим, что модель с самым высоким уровнем предвзятости — это GPT-3.5 Turbo, в то время как у всех более новых моделей уровень предвзятости по всем задачам составляет менее 1%.
В LMRA были предложены объяснения на естественном языке, раскрывающие суть различий в каждой задаче. В исследовании отмечались периодические различия в тоне, языковой сложности и степени детализации ответов ChatGPT во всех задачах. Помимо очевидных стереотипов, эти различия включали также нюансы, которые одни пользователи могут счесть полезными, а другие — нет. Например, в задаче «Напиши историю» ответы пользователям с именами, звучащими по-женски, чаще содержат персонажей-женщин, чем ответы пользователям с именами, звучащими по-мужски.
Хотя отдельные пользователи вряд ли заметят эти различия, мы считаем важным их измерять и понимать, поскольку даже редкие паттерны в совокупности могут нанести вред. Этот подход также дает нам новый способ статистического отслеживания изменений с течением времени. Методы исследования, разработанные нами для этой работы, могут быть также распространены на изучение предвзятости в ChatGPT, выходящей за рамки имен. Чтобы узнать подробности, мы рекомендуем ознакомиться с нашим полным отчетом, в котором исследуются 3 метрики справедливости для 2 гендеров, 4 рас и этнических принадлежностей, 66 задач, 9 доменов и 6 языковых моделей.
Ограничения
Понимание принципов справедливости в языковых моделях — это обширная область исследований, и мы признаем, что наше исследование имеет ограничения. Не у всех есть имена, кроме того, помимо имен, на справедливость ChatGPT при взаимодействии от первого лица влияют и другие факторы. Исследование в первую очередь сосредоточено на взаимодействии на английском языке, бинарных гендерных ассоциациях на основе распространенных в США имен, а также на четырех расах и этнических группах (темнокожие, азиаты, латиноамериканцы и белые). В данной работе рассматриваются только текстовые взаимодействия, хотя мы отмечаем, что справедливость от первого лица в отношении демографических характеристик говорящего в аудиоанализе рассматривается в системной карте GPT‑4o (см. раздел «Различия в производительности при голосовом вводе»). Хотя мы считаем эту методологию шагом вперед, предстоит проделать еще много работы, чтобы понять предвзятость, связанную с другими демографическими группами, языками и культурными контекстами. Мы планируем продолжить эти исследования, чтобы сделать системы более справедливыми в широком смысле.
Заключение
Хотя вредные стереотипы сложно свести к какому-то одному числу, мы уверены, что разработка новых методов измерения и понимания предвзятости — важный шаг на пути к возможности отслеживать ее и снижать ее уровень с течением времени. Метод, использованный в этом исследовании, теперь входит в наш стандартный набор средств оценки производительности моделей и будет учитываться при принятии решений о развертывании будущих систем. Полученные знания также поддержат наши усилия по дальнейшему уточнению операционного значения справедливости в наших системах. Справедливость остается актуальной областью исследований, и мы поделились примерами наших исследований в этой сфере в системных картах GPT‑4o и OpenAI o1 (например, при сравнении точности распознавания речи для различных демографических групп говорящих).
Мы убеждены, что прозрачность и постоянное совершенствование — залог как устранения предвзятости, так и укрепления доверия со стороны наших пользователей и более широкого исследовательского сообщества. Чтобы поддержать воспроизводимость результатов и дальнейшие исследования справедливости, мы также публикуем подробные системные сообщения, использованные в этом исследовании, чтобы внешние исследователи могли самостоятельно проводить эксперименты по выявлению предвзятости от первого лица (подробности приведены в нашей научной работе).
Мы приветствуем отзывы и сотрудничество. Если у вас есть идеи или вы хотите поработать с нами над повышением справедливости ИИ, мы будем рады услышать вас, а если вы хотите сосредоточиться на решении этих задач вместе с нами, мы нанимаем сотрудников.
Автор
Полный текст статьи читайте на OpenAI
