TruthfulQA: Оценка того, как модели имитируют человеческие заблуждения

Аннотация
Мы предлагаем бенчмарк для измерения того, насколько языковая модель правдива при генерации ответов на вопросы. Бенчмарк включает 817 вопросов, охватывающих 38 категорий, включая здравоохранение, право, финансы и политику. Мы создали вопросы, на которые некоторые люди ответили бы неверно из-за ложных убеждений или заблуждений. Чтобы успешно справиться с задачей, модели должны избегать генерации ложных ответов, усвоенных в результате имитации человеческих текстов. Мы протестировали GPT‑3, GPT‑Neo/J, GPT‑2 и модель на базе T5. Лучшая модель дала правдивые ответы на 58% вопросов, в то время как результат людей составил 94%. Модели сгенерировали множество ложных ответов, которые имитируют популярные заблуждения и потенциально могут вводить людей в заблуждение. Самые крупные модели в целом оказались наименее правдивыми. Это контрастирует с другими задачами НОП (обработки естественного языка), где производительность улучшается с ростом размера модели. Тем не менее, такой результат вполне ожидаем, если ложные ответы заимствуются из обучающего распределения. Мы предполагаем, что простое увеличение масштаба моделей менее перспективно для повышения их правдивости, чем тонкая настройка (fine-tuning) с использованием целевых функций, отличных от имитации веб-текстов.
Авторы
Полный текст статьи читайте на OpenAI
