Почему языковые модели галлюцинируют

В OpenAI мы усердно работаем над тем, чтобы сделать ИИ-системы более полезными и надежными. Несмотря на рост возможностей языковых моделей, одна проблема остается исключительно сложной для полного решения — галлюцинации. Под этим мы понимаем случаи, когда модель с уверенностью выдает ложный ответ. В нашей новой научной статье утверждается, что языковые модели галлюцинируют из-за того, что стандартные процедуры обучения и оценки вознаграждают угадывание, а не признание неопределенности.
ChatGPT тоже галлюцинирует. У GPT-5 галлюцинаций значительно меньше, особенно в процессах рассуждения, но они все же случаются. Галлюцинации остаются фундаментальной проблемой для всех больших языковых моделей, однако мы прилагаем все усилия для их дальнейшего сокращения.
Что такое галлюцинации?
Галлюцинации — это правдоподобные, но ложные утверждения, генерируемые языковыми моделями. Они могут проявляться самым неожиданным образом даже при ответе на, казалось бы, простые вопросы. Например, когда мы попросили популярный чат-бот назвать тему докторской диссертации Адама Таумана Калаи (одного из авторов этой статьи), он с уверенностью выдал три разных ответа — и ни один из них не был правильным. Когда мы спросили о его дне рождения, бот назвал три разные даты, и все они также оказались неверными.
Натаскивание на тесты
Галлюцинации сохраняются во многом потому, что существующие методы оценки формируют неправильные стимулы. Хотя сами тесты напрямую не вызывают галлюцинаций, большинство систем оценки измеряют производительность моделей таким образом, который поощряет угадывание, а не честность в отношении неопределенности.
Подумайте о тесте с вариантами ответов. Если вы не знаете ответа, но наугад выбираете вариант, вам может повезти, и вы окажетесь правы. Оставить поле пустым гарантирует ноль баллов. Точно так же, когда модели оцениваются исключительно по точности — по проценту абсолютно верных ответов — их стимулируют угадывать, а не говорить «Я не знаю».
Другой пример: предположим, у языковой модели спрашивают чей-то день рождения, но она его не знает. Если она наугад называет »10 сентября», у нее есть шанс 1 из 365 оказаться правой. Ответ «Я не знаю» гарантирует ноль баллов. Спустя тысячи тестовых вопросов модель, которая угадывает, в итоговых таблицах лидеров выглядит лучше, чем осторожная модель, признающая свою неопределенность.
Для вопросов, имеющих единственный «правильный ответ», можно выделить три категории реакций: точные ответы, ошибки и воздержание от ответа (абстиненция), когда модель не рискует угадывать. Воздержание от ответа — это проявление смирения, одной из базовых ценностей OpenAI. Большинство таблиц лидеров ставят на первое место и ранжируют модели по точности, однако ошибки хуже, чем воздержание от ответа. В нашей спецификации моделей указано, что лучше выразить неуверенность или запросить уточнение, чем предоставлять уверенную, но потенциально неверную информацию.
В качестве конкретного примера рассмотрим бенчмарк SimpleQA из системной карты GPT-5.
Метрика | gpt-5-thinking-mini | OpenAI o4-mini |
Доля воздержаний от ответа | 52% | 1% |
Уровень точности | 22% | 24% |
Уровень ошибок | 26% | 75% |
Итого | 100% | 100% |
По показателю точности более старая модель OpenAI o4-mini работает немного лучше. Однако уровень ее ошибок (то есть частота галлюцинаций) значительно выше. Стратегическое угадывание при неуверенности повышает точность, но увеличивает количество ошибок и галлюцинаций.
При усреднении результатов по дюжинам тестов большинство бенчмарков выносят на первый план метрику точности, однако это приводит к ложной дихотомии между правильным и неправильным. На простых тестах вроде SimpleQA некоторые модели достигают почти 100% точности и тем самым исключают галлюцинации. Тем не менее, в более сложных тестах и при реальном использовании точность ограничена планкой ниже 100%, поскольку существуют вопросы, на которые невозможно дать однозначный ответ по ряду причин: из-за отсутствия информации, ограниченных возможностей мышления небольших моделей или неоднозначностей, требующих уточнения.
Тем не менее, таблицы лидеров и карточки моделей по-прежнему ориентированы исключительно на точность, побуждая разработчиков создавать модели, которые угадывают, а не сдерживаются. Именно поэтому, даже по мере совершенствования моделей, они все равно могут галлюцинировать, с уверенностью выдавая неверные ответы вместо признания неуверенности.
Лучший способ оценивания моделей
Существует простое решение. Штрафуйте за уверенные ошибки сильнее, чем за неуверенность, и давайте частичные баллы за адекватное выражение неопределенности. Эта идея не нова. Некоторые стандартизированные тесты уже давно используют различные формы штрафных баллов за неверные ответы или частичное начисление баллов за оставленные без ответа вопросы, чтобы отбить охоту к слепому угадыванию. Несколько исследовательских групп также изучали методы оценки, учитывающие неопределенность и калибровку.
Наша позиция заключается в другом. Недостаточно просто добавить несколько новых тестов на учет неопределенности. Широко используемые тесты, основанные на точности, нуждаются в обновлении, чтобы их система баллов препятствовала угадыванию. Если главные таблицы лидеров продолжат вознаграждать счастливые догадки, модели продолжат учиться угадывать. Исправление систем оценки может ускорить внедрение методов сокращения галлюцинаций — как недавно разработанных, так и предложенных в рамках предыдущих исследований.
Как галлюцинации проистекают из прогнозирования следующего слова
Мы обсудили, почему от галлюцинаций так сложно избавиться, но откуда вообще берутся эти высокоспецифичные фактические ошибки? В конце концов, крупные предобученные модели редко допускают ошибки других типов, например, орфографические опечатки или несоответствие скобок. Разница кроется в том, какие именно паттерны присутствуют в данных.
Языковые модели сначала обучаются посредством предобучения — процесса прогнозирования следующего слова в огромных массивах текста. В отличие от традиционных задач машинного обучения, здесь к каждому утверждению не привязаны метки «верно/неверно». Модель видит только позитивные примеры грамотного языка и должна аппроксимировать общее распределение.
Вдвойне трудно отличить правильные утверждения от неправильных, когда у вас нет примеров с меткой неверных. Но даже при наличии меток некоторые ошибки неизбежны. Чтобы понять почему, рассмотрим более простой пример. В распознавании образов, если миллионы фотографий кошек и собак помечены как «кот» или «собака», алгоритмы могут научиться надежно их классифицировать. Но представьте вместо этого разметку каждой фотографии питомца по дню его рождения. Поскольку дни рождения по сути случайны, эта задача всегда будет приводить к ошибкам, сколь бы продвинутым ни был алгоритм.
Тот же принцип применим и к предобучению. Орфография и скобки подчиняются устойчивым закономерностям, поэтому ошибки в них исчезают по мере масштабирования. Но случайные низкочастотные факты, такие как день рождения питомца, невозможно предсказать только на основе закономерностей, и поэтому они приводят к галлюцинациям. Наш анализ объясняет, какого рода галлюцинации должны возникать из прогнозирования следующего слова. В идеале последующие этапы после предобучения должны устранять их, но это удается не полностью по причинам, описанным в предыдущем разделе.
Заключение
Мы надеемся, что предложенный в нашей статье статистический взгляд проливает свет на природу галлюцинаций и опровергает распространенные заблуждения:
- Утверждение: Галлюцинации будут устранены за счет повышения точности, поскольку модель со 100% точностью никогда не галлюцинирует.
Вывод: Точность никогда не достигнет 100%, потому что, независимо от размера модели, возможностей поиска и рассуждения, некоторые вопросы из реального мира принципиально не имеют ответов. - Утверждение: Галлюцинации неизбежны.
Вывод: Это не так, поскольку языковые модели могут воздерживаться от ответов при неуверенности. - Утверждение: Избежание галлюцинаций требует уровня интеллекта, достижимого исключительно для более крупных моделей.
Вывод: Маленькой модели иногда проще знать свои пределы. Например, когда ее просят ответить на вопрос на языке маори, маленькая модель, не знающая маори, может просто сказать «Я не знаю», в то время как модель, немного владеющая маори, вынуждена определять степень своей уверенности. Как обсуждается в статье, «калибровка» требует гораздо меньше вычислений, чем точность. - Утверждение: Галлюцинации — это загадочный сбой в современных языковых моделях.
Вывод: Мы понимаем статистические механизмы, посредством которых возникают галлюцинации и за которые они вознаграждаются в тестах. - Утверждение: Для измерения галлюцинаций нам просто нужен хороший тест на галлюцинации.
Вывод: Тесты на галлюцинации уже опубликованы. Однако хороший тест на галлюцинации мало что меняет на фоне сотен традиционных тестов на основе точности, которые штрафуют за смирение и вознаграждают за угадывание. Вместо этого все основные метрики оценки необходимо переработать так, чтобы вознаграждать выражение неопределенности.
Наши новейшие модели обладают более низкими показателями галлюцинаций, и мы продолжаем упорно работать над дальнейшим снижением частоты уверенных ошибок, выдаваемых нашими языковыми моделями.
Авторы анонса
Адам Калай (Adam Kalai), Сантош Вемпала (Santosh Vempala, Технологический институт Джорджии), Офир Нахум (Ofir Nachum), Эдди Чжан (Eddie Zhang), Дэвид Робинсон (David Robinson), Саачи Джайн (Saachi Jain), Эрик Митчелл (Eric Mitchell), Алекс Бойтель (Alex Beutel), Йоханнес Хайдеке (Johannes Heidecke)
Полный текст статьи читайте на OpenAI
