Представляем SimpleQA

Бенчмарк фактологичности под названием SimpleQA, который измеряет способность языковых моделей отвечать на короткие вопросы, требующие точных фактов.
Нерешенной проблемой в искусственном интеллекте остается то, как обучать модели выдавать фактологически верные ответы. Существующие языковые модели иногда выдают ложные результаты или ответы, не подтвержденные доказательствами — проблема, известная как «галлюцинации». Языковые модели, которые генерируют более точные ответы с меньшим количеством галлюцинаций, вызывают больше доверия и могут применяться в самых разных областях. Чтобы измерить фактологичность языковых моделей, мы выпускаем в открытом доступе новый бенчмарк под названием SimpleQA.
О бенчмарке SimpleQA
Фактологичность — сложная тема, поскольку ее трудно измерить: оценка правильности любого произвольного утверждения представляет собой непростую задачу, а языковые модели могут создавать длинные тексты, содержащие десятки фактологических утверждений. В SimpleQA мы сосредоточились на коротких вопросах, требующих фактов, что сужает масштаб бенчмарка, но делает измерение фактологичности гораздо более выполнимым.
Создавая SimpleQA, мы ставили перед собой задачу разработать набор данных со следующими свойствами:
- Высокая правильность. Эталонные ответы на вопросы подтверждены источниками от двух независимых ИИ-тренеров, а формулировки вопросов составлены так, чтобы ответы было легко оценивать.
- Разнообразие. SimpleQA охватывает широкий спектр тем: от науки и технологий до телешоу и видеоигр.
- Сложность для передовых моделей. По сравнению с более старыми бенчмарками, такими как TriviaQA (2017) или NQ (2019), которые уже исчерпали свой потенциал, SimpleQA создавался как серьезное испытание для передовых моделей (например, GPT‑4o набирает менее 40%).
- Удобство для исследователей (UX). SimpleQA задуман как быстрый и простой в запуске инструмент благодаря лаконичным вопросам и ответам. Процесс оценки также эффективен независимо от того, используется ли API OpenAI или API другой передовой модели. Кроме того, благодаря 4326 вопросам SimpleQA должен обладать относительно низкой дисперсией в качестве оценочного бенчмарка.
Мы наняли ИИ-тренеров для поиска в интернете и создания коротких вопросов, требующих точных фактов, и соответствующих ответов. Чтобы попасть в набор данных, каждый вопрос должен был соответствовать строгим критериям: иметь единственный неоспоримый ответ для удобства проверки; ответ на вопрос не должен меняться со временем; и большинство вопросов должны были провоцировать галлюцинации у GPT‑4o или GPT‑3.5. Для дальнейшего повышения качества набора данных второй независимый ИИ-тренер отвечал на каждый вопрос, не видя исходного ответа. В финальную версию включались только те вопросы, ответы обоих тренеров на которые совпадали.
В качестве финальной проверки качества мы попросили третьего ИИ-тренера ответить на случайную выборку из 1000 вопросов из набора данных. Мы выяснили, что ответы третьего тренера совпадали с исходными согласованными ответами в 94,4% случаев, а уровень расхождений составил 5,6%. Затем мы вручную изучили эти примеры и обнаружили, что 2,8% из этих 5,6% расхождений были вызваны ложноотрицательными оценками или человеческими ошибками со стороны третьего тренера (например, неполными ответами или неверной интерпретацией источников), а оставшиеся 2,8% были связаны с реальными проблемами в самих вопросах (например, двусмысленностью вопросов или противоречивыми данными на разных сайтах). Таким образом, мы оцениваем присущую этому набору данных погрешность примерно в 3%.
Разнообразие вопросов в SimpleQA
Круговая диаграмма ниже демонстрирует разнообразие тем в бенчмарке SimpleQA. При наведении курсора на сектора диаграммы отображаются примеры вопросов для каждой категории.
Использование SimpleQA для сравнения языковых моделей
Для оценки вопросов мы используем классификатор на базе ChatGPT, которому передаются как предсказанный моделью ответ, так и эталонный правильный ответ. Затем классификатор оценивает предсказанный ответ как «correct» (верный), «incorrect» (неверный) или «not attempted» (не предпринято).
Определение и соответствующие примеры для каждой оценки приведены в таблице ниже.
| Оценка | Определение | Примеры для вопроса «Какой нидерландский игрок забил гол с игры в матче Нидерланды — Аргентина на мужском чемпионате мира по футболу 2022 года?» (Ответ: Ваут Вегхорст) |
|---|---|---|
| «Correct» (Верно) | Предсказанный ответ полностью содержит эталонный ответ и не противоречит ему. |
|
| «Incorrect» (Неверно) | Предсказанный ответ в любой форме противоречит эталонному ответу, даже если противоречие выражено неуверенно. |
|
| «Not attempted» (Не предпринято) | Эталонный ответ представлен не полностью, при этом в ответе нет противоречий с эталоном. |
|
В идеале модель должна отвечать на как можно большее количество вопросов (максимальное число правильных ответов), сводя к минимуму количество неверных.
Используя эту классификацию, мы можем измерить производительность нескольких моделей OpenAI без использования поиска, включая gpt-4o-mini, o1‑mini, gpt-4o и o1‑preview. Как и ожидалось, gpt-4o-mini и o1‑mini дают меньше правильных ответов по сравнению с gpt-4o и o1‑preview, вероятно, потому что меньшие модели обычно обладают меньшим объемом знаний о мире. Мы также видим, что o1‑mini и o1‑preview, созданные с расчетом на большее время для размышлений, чаще выбирают вариант «не предпринимать попытку» ответить на вопрос по сравнению с gpt-4o-mini и gpt-4o. Это может быть связано с тем, что они используют свои возможности логического рассуждения, чтобы распознать, когда они не знают ответа на вопрос, вместо того чтобы галлюцинировать.
Использование SimpleQA для измерения калибровки больших языковых моделей
Такой бенчмарк фактологичности, как SimpleQA, также позволяет нам измерять научное явление, известное как калибровка, или способность языковых моделей «знать то, что они знают». Один из способов измерения калибровки заключается в том, чтобы напрямую попросить языковую модель выразить свою уверенность в ответе с помощью промпта: «Пожалуйста, укажите ваше наилучшее предположение, а также степень вашей уверенности в процентах в том, что это правильный ответ». Затем мы можем построить график корреляции между заявленной уверенностью модели и тем, насколько точным был ее ответ на самом деле. У идеально откалиброванной модели фактическая точность совпадала бы с заявленной уверенностью. Например, для всех промптов, где модель заявляла об уверенности в 75%, точность у идеально откалиброванной модели составляла бы 75%.
Этот результат показан на рисунке ниже. Положительная корреляция между заявленной уверенностью и точностью — обнадеживающий признак того, что модели обладают определенным представлением о собственной уверенности. Мы видим, что o1‑preview откалибрована лучше, чем o1‑mini, а gpt4o откалибрована лучше, чем gpt4o-mini, что согласуется с предыдущими исследованиями, показывающими, что более крупные модели откалиброваны лучше. Тем не менее, тот факт, что показатели эффективности находятся значительно ниже прямой y=x, означает, что модели стабильно переоценивают свою уверенность. Следовательно, существует большой простор для улучшения калибровки больших языковых моделей с точки зрения заявленной уверенности.
Другой способ измерения калибровки — задать языковой модели один и тот же вопрос 100 раз. Поскольку при повторяющихся попытках языковые модели могут давать разные ответы, мы можем оценить, соответствует ли частота определенного ответа его правильности. Более высокая частота обычно указывает на то, что модель более уверена в своих ответах, так как она выдает один и тот же ответ снова и снова. У хорошо откалиброванной модели фактическая точность должна совпадать с частотой.
На приведенном ниже графике мы показываем калибровку языковых моделей, измеренную по частоте их ответов. Здесь мы просто используем сопоставление строк для группировки различных ответов языковой модели. Мы видим, что во всех моделях точность возрастает с увеличением частоты, причем o1‑preview демонстрирует наивысший уровень калибровки, при котором частота ответа примерно эквивалентна его точности. Аналогично графику калибровки по заявленной уверенности выше, мы снова видим, что o1‑preview откалибрована лучше, чем o1‑mini, а gpt4o откалибрована лучше, чем o1‑mini.
Выводы
SimpleQA — это простой, но сложный бенчмарк для оценки фактической точности передовых моделей. Главное ограничение SimpleQA заключается в его охвате: хотя SimpleQA точен, он измеряет фактичность только в рамках ограниченного набора коротких запросов, нацеленных на получение фактов, с единственным проверяемым ответом. Связана ли способность предоставлять фактические короткие ответы со способностью писать длинные тексты, содержащие множество фактов, остается открытым вопросом для исследований. Мы надеемся, что открытие исходного кода SimpleQA будет способствовать развитию исследований в области более надежного и заслуживающего доверия ИИ, и приглашаем исследователей использовать его для оценки фактичности языковых моделей и делиться с нами своими отзывами.
Авторы
Благодарности
Полный текст статьи читайте на OpenAI
