WebGPT: Повышение фактологической точности языковых моделей с помощью веб-серфинга
Мы дообучили GPT‑3 более точно отвечать на открытые вопросы с помощью текстового веб-браузера.

Мы дообучили GPT‑3 более точно отвечать на открытые вопросы с помощью текстового веб-браузера. Наш прототип копирует действия людей при поиске ответов на вопросы в интернете: он отправляет поисковые запросы, переходит по ссылкам и прокручивает веб-страницы вверх и вниз. Модель обучена цитировать свои источники, что облегчает предоставление обратной связи для повышения фактологической точности. Мы воодушевлены перспективами создания более правдивого ИИ,
Языковые модели вроде GPT‑3 полезны для самых разных задач, но имеют тенденцию «галлюцинировать» информацию при выполнении задач, требующих малоизвестных реальных знаний.,
Модель дообучается из GPT‑3 с помощью техжеобщихметодов, которые мы использовали ранее. Мы начинаем с обучения модели копированию действий человека, что дает ей способность использовать текстовый браузер для ответов на вопросы. Затем мы повышаем полезность и точность ответов модели, обучая модель вознаграждения предсказывать человеческие предпочтения и оптимизируя ее с помощью обучения с подкреплением или выборки с отклонением.
Результаты на ELI5
Наша система обучена отвечать на вопросы из ELI5, 4 набора данных открытых вопросов, собранных с сабреддита «Explain Like I«m Five» («Объясни как пятилетнему»). Мы обучили три разные модели, соответствующие трем различным вычислительным бюджетам на этапе инференса. Наша лучшая модель генерирует ответы, которые в 56% случаев предпочитаются ответам, написанным нашими тестировщиками-людьми, при аналогичном уровне фактологической точности. Несмотря на то что использовались те же демонстрации, что и при обучении модели, мы смогли превзойти их за счет использования обратной связи от человека для улучшения ответов модели.
Результаты TruthfulQA
Для вопросов из обучающего распределения ответы нашей лучшей модели в среднем примерно так же фактологически точны, как и те, что написаны людьми-демонстраторами. Тем не менее, надежность вне обучающего распределения остается сложной задачей. Чтобы проверить это, мы оценили наши модели на TruthfulQA,
Наши модели превосходят GPT‑3 на TruthfulQA и демонстрируют более благоприятные свойства масштабирования. Тем не менее, наши модели отстают от людей по производительности, отчасти потому, что они иногда цитируют ненадежные источники (как показано в вопросе о призраках выше). Мы надеемся снизить частоту таких сбоев с помощью таких методов, как состязательное обучение.
Оценка фактологической точности
Чтобы предоставлять обратную связь для повышения фактологической точности, люди должны иметь возможность оценивать фактическую точность утверждений, создаваемых моделями. Это может быть крайне сложно, поскольку утверждения могут быть техническими, субъективными или расплывчатыми. По этой причине мы требуем, чтобы модель цитировала свои источники.
Тем не менее, такой подход вызывает ряд вопросов. Что делает источник надежным? Какие утверждения достаточно очевидны, чтобы не требовать подтверждения? Какой компромисс следует искать между оценками фактологической точности и другими критериями, такими как когерентность? Все это были сложные оценочные суждения. Мы не думаем, что наша модель учла большую часть этих нюансов, поскольку она все еще совершает базовые ошибки. Но мы ожидаем, что подобные решения будут приобретать все большее значение по мере совершенствования систем ИИ, и для разработки практически применимых и эпистемически обоснованных критериев необходимы междисциплинарные исследования. Мы также ожидаем, что важную роль будут играть дополнительные соображения, такие как прозрачность.
Со временем простого цитирования источников моделью станет недостаточно для оценки фактологической точности. Достаточно способная модель будет тщательно отбирать источники, которые, по ее мнению, покажутся людям убедительными, даже если они не отражают справедливую оценку доказательств. Признаки этого наблюдаются уже сейчас (см. вопросы о лодках выше). Мы надеемся смягчить этот эффект с помощью таких методов, как дебаты.
Риски развертывания и обучения
Хотя наша модель в целом более правдива, чем GPT‑3 (поскольку она реже генерирует ложные утверждения), она все же несет в себе определенные риски. Ответы с цитатами часто воспринимаются как обладающие ореолом авторитетности, что может затушевывать тот факт, что наша модель по-прежнему совершает элементарные ошибки. Модель также склонна подкреплять уже имеющиеся у пользователей убеждения. Мы исследуем лучшие способы решения этих и других проблем.
В дополнение к рискам развертывания наш подход создает новые риски во время обучения, предоставляя модели доступ к сети. Наша среда браузера не предоставляет полный доступ к интернету, но позволяет модели отправлять запросы в API поиска Microsoft Bing и переходить по уже существующим в сети ссылкам, что может иметь побочные эффекты. Судя по нашему опыту работы с GPT‑3, модель пока и близко не обладает достаточными способностями, чтобы опасно эксплуатировать эти побочные эффекты. Тем не менее, эти риски возрастают по мере роста возможностей моделей, и мы работаем над созданием внутренних средств защиты от них.
Заключение
Человеческая обратная связь и такие инструменты, как веб-браузеры, открывают многообещающий путь к созданию надежно правдивых систем общего назначения на базе искусственного интеллекта. Наша нынешняя система испытывает трудности в сложных или незнакомых ситуациях, но тем не менее представляет собой значительный прогресс в этом направлении.
Если вы хотите помочь нам в создании более полезных и правдивых систем ИИ, мы нанимаем сотрудников!
Ссылки
Авторы
Выражение признательности
Спасибо нашим соавторам статьи: Jeff Wu, Long Ouyang, Christina Kim, Christopher Hesse, Shantanu Jain, Vineet Kosaraju, William Saunders, Roger Jiang, Karl Cobbe, Tyna Eloundou, Gretchen Krueger, Kevin Button, Matthew Knight и Benjamin Chess.
Спасибо тем, кто помогал с этим релизом и оставлял отзывы: Steven Adler, Sam Altman, Beth Barnes, Miles Brundage, Kevin Button, Steve Dowling, Alper Ercetin, Matthew Knight, Gretchen Krueger, Ryan Lowe, Andrew Mayne, Bob McGrew, Mira Murati, Richard Ngo, Jared Salzano, Natalie Summers и Hannah Wong.
Спасибо команде Surge AI за помощь в сборе данных, а также всем нашим подрядчикам за предоставление демонстраций и сравнений, без которых этот проект был бы невозможен.
Полный текст статьи читайте на OpenAI
