WebGPT: Повышение фактологической точности языковых моделей с помощью веб-серфинга

Мы дообучили GPT‑3 более точно отвечать на открытые вопросы с помощью текстового веб-браузера.

Читать статьюПосмотреть примеры
WebGPT Improving The Factual Accuracy Of Language Models Through Web Browsing

Мы дообучили GPT‑3 более точно отвечать на открытые вопросы с помощью текстового веб-браузера. Наш прототип копирует действия людей при поиске ответов на вопросы в интернете: он отправляет поисковые запросы, переходит по ссылкам и прокручивает веб-страницы вверх и вниз. Модель обучена цитировать свои источники, что облегчает предоставление обратной связи для повышения фактологической точности. Мы воодушевлены перспективами создания более правдивого ИИ, 1 однако остаются и трудности, такие как работа с незнакомыми типами вопросов.

Языковые модели вроде GPT‑3 полезны для самых разных задач, но имеют тенденцию «галлюцинировать» информацию при выполнении задач, требующих малоизвестных реальных знаний.2, 3 Чтобы решить эту проблему, мы научили GPT‑3 использовать текстовый веб-браузер. Модели передается открытый вопрос и сводка состояния браузера, после чего она должна отдавать такие команды, как «Search …», «Find in page: …» или «Quote: …». Таким образом модель собирает фрагменты текста с веб-страниц и затем использует их для составления ответа.

Модель дообучается из GPT‑3 с помощью техжеобщихметодов, которые мы использовали ранее. Мы начинаем с обучения модели копированию действий человека, что дает ей способность использовать текстовый браузер для ответов на вопросы. Затем мы повышаем полезность и точность ответов модели, обучая модель вознаграждения предсказывать человеческие предпочтения и оптимизируя ее с помощью обучения с подкреплением или выборки с отклонением.

Результаты на ELI5

Наша система обучена отвечать на вопросы из ELI5, 4 набора данных открытых вопросов, собранных с сабреддита «Explain Like I«m Five» («Объясни как пятилетнему»). Мы обучили три разные модели, соответствующие трем различным вычислительным бюджетам на этапе инференса. Наша лучшая модель генерирует ответы, которые в 56% случаев предпочитаются ответам, написанным нашими тестировщиками-людьми, при аналогичном уровне фактологической точности. Несмотря на то что использовались те же демонстрации, что и при обучении модели, мы смогли превзойти их за счет использования обратной связи от человека для улучшения ответов модели.

Результаты TruthfulQA

Для вопросов из обучающего распределения ответы нашей лучшей модели в среднем примерно так же фактологически точны, как и те, что написаны людьми-демонстраторами. Тем не менее, надежность вне обучающего распределения остается сложной задачей. Чтобы проверить это, мы оценили наши модели на TruthfulQA, 5 наборе данных кратких вопросов, сконструированном состязательным образом и предназначенном для проверки того, поддаются ли модели таким вещам, как распространенные заблуждения. Ответы оцениваются по правдивости и информативности, которые находятся в обратной зависимости друг от друга (например, фраза «У меня нет комментариев» считается правдивой, но не информативной).

Наши модели превосходят GPT‑3 на TruthfulQA и демонстрируют более благоприятные свойства масштабирования. Тем не менее, наши модели отстают от людей по производительности, отчасти потому, что они иногда цитируют ненадежные источники (как показано в вопросе о призраках выше). Мы надеемся снизить частоту таких сбоев с помощью таких методов, как состязательное обучение.

Оценка фактологической точности

Чтобы предоставлять обратную связь для повышения фактологической точности, люди должны иметь возможность оценивать фактическую точность утверждений, создаваемых моделями. Это может быть крайне сложно, поскольку утверждения могут быть техническими, субъективными или расплывчатыми. По этой причине мы требуем, чтобы модель цитировала свои источники.6 Это позволяет людям оценивать фактологическую точность, проверяя,  подтверждено ли утверждение надежным источником. Помимо того, что это делает задачу более управляемой, это также снижает ее двусмысленность, что важно для уменьшения зашумленности разметок.

Тем не менее, такой подход вызывает ряд вопросов. Что делает источник надежным? Какие утверждения достаточно очевидны, чтобы не требовать подтверждения? Какой компромисс следует искать между оценками фактологической точности и другими критериями, такими как когерентность? Все это были сложные оценочные суждения. Мы не думаем, что наша модель учла большую часть этих нюансов, поскольку она все еще совершает базовые ошибки. Но мы ожидаем, что подобные решения будут приобретать все большее значение по мере совершенствования систем ИИ, и для разработки практически применимых и эпистемически обоснованных критериев необходимы междисциплинарные исследования. Мы также ожидаем, что важную роль будут играть дополнительные соображения, такие как прозрачность.1

Со временем простого цитирования источников моделью станет недостаточно для оценки фактологической точности. Достаточно способная модель будет тщательно отбирать источники, которые, по ее мнению, покажутся людям убедительными, даже если они не отражают справедливую оценку доказательств. Признаки этого наблюдаются уже сейчас (см. вопросы о лодках выше). Мы надеемся смягчить этот эффект с помощью таких методов, как дебаты.

Риски развертывания и обучения

Хотя наша модель в целом более правдива, чем GPT‑3 (поскольку она реже генерирует ложные утверждения), она все же несет в себе определенные риски. Ответы с цитатами часто воспринимаются как обладающие ореолом авторитетности, что может затушевывать тот факт, что наша модель по-прежнему совершает элементарные ошибки. Модель также склонна подкреплять уже имеющиеся у пользователей убеждения. Мы исследуем лучшие способы решения этих и других проблем.

В дополнение к рискам развертывания наш подход создает новые риски во время обучения, предоставляя модели доступ к сети. Наша среда браузера не предоставляет полный доступ к интернету, но позволяет модели отправлять запросы в API поиска Microsoft Bing и переходить по уже существующим в сети ссылкам, что может иметь побочные эффекты. Судя по нашему опыту работы с GPT‑3, модель пока и близко не обладает достаточными способностями, чтобы опасно эксплуатировать эти побочные эффекты. Тем не менее, эти риски возрастают по мере роста возможностей моделей, и мы работаем над созданием внутренних средств защиты от них.

Заключение

Человеческая обратная связь и такие инструменты, как веб-браузеры, открывают многообещающий путь к созданию надежно правдивых систем общего назначения на базе искусственного интеллекта. Наша нынешняя система испытывает трудности в сложных или незнакомых ситуациях, но тем не менее представляет собой значительный прогресс в этом направлении.

Если вы хотите помочь нам в создании более полезных и правдивых систем ИИ, мы нанимаем сотрудников!

Ссылки

  1. 1

    O. Evans, O. Cotton-Barratt, L. Finnveden, A. Bales, A. Balwit, P. Wills, L. Righetti, and W. Saunders. Truthful AI: Developing and governing AI that does not lie. arXiv preprint arXiv:2110.06674,  2021.

  2. 2

    J. Maynez, S. Narayan, B. Bohnet, and R. McDonald. On faithfulness and factuality in abstractive summarization. arXiv preprint arXiv:2005.00661,  2020.

  3. 3

    K. Shuster, S. Poff, M. Chen, D. Kiela, and J. Weston. Retrieval augmentation reduces hallucination in conversation. arXiv preprint arXiv:2104.07567,  2021.

  4. 4

    A. Fan, Y. Jernite, E. Perez, D. Grangier, J. Weston, and M. Auli. ELI5: Long form question answering. arXiv preprint arXiv:1907.09190,  2019.

  5. 5

    S. Lin, J. Hilton, and O. Evans. TruthfulQA: Measuring how models mimic human falsehoods. arXiv preprint arXiv:2109.07958,  2021.

  6. 6

    D. Metzler, Y. Tay, D. Bahri, and M. Najork. Rethinking search: Making experts out of dilettantes. arXiv preprint arXiv:2105.02274,  2021.

Авторы

Jacob Hilton, Reiichiro Nakano, Suchir Balaji, John Schulman

Выражение признательности

Спасибо нашим соавторам статьи: Jeff Wu, Long Ouyang, Christina Kim, Christopher Hesse, Shantanu Jain, Vineet Kosaraju, William Saunders, Roger Jiang, Karl Cobbe, Tyna Eloundou, Gretchen Krueger, Kevin Button, Matthew Knight и Benjamin Chess.

Спасибо тем, кто помогал с этим релизом и оставлял отзывы: Steven Adler, Sam Altman, Beth Barnes, Miles Brundage, Kevin Button, Steve Dowling, Alper Ercetin, Matthew Knight, Gretchen Krueger, Ryan Lowe, Andrew Mayne, Bob McGrew, Mira Murati, Richard Ngo, Jared Salzano, Natalie Summers и Hannah Wong.

Спасибо команде Surge AI за помощь в сборе данных, а также всем нашим подрядчикам за предоставление демонстраций и сравнений, без которых этот проект был бы невозможен.

Полный текст статьи читайте на OpenAI