GPT‑4

image-21.webp?w=1600&h=900&fit=fill
Читать научную статьюПосмотреть описание системыПопробовать в ChatGPT Plus
Другие ресурсы
Попробовать в PlaygroundПосмотреть запись трансляцииВнести вклад в OpenAI Evals

Мы создали GPT‑4 — последний рубеж в усилиях OpenAI по масштабированию глубокого обучения. GPT‑4 представляет собой крупную мультимодальную модель (принимающую на вход изображения и текст и выдающую текстовый вывод), которая, хотя и уступает людям в ряде реальных сценариев, демонстрирует производительность человеческого уровня на различных профессиональных и академических бенчмарках. Например, она успешно сдает имитационный квалификационный экзамен на адвоката (bar exam), набирая баллы, соответствующие примерно верхней центили в 10% среди сдающих; для сравнения, результат GPT‑3.5 находился в районе нижних 10%. Мы потратили 6 месяцев на итеративную настройку согласованности (alignment) GPT‑4, используя уроки нашей программы состязательного тестирования (adversarial testing), а также опыт ChatGPT, что привело к нашим лучшим на сегодняшний день результатам (хотя они и далеки от идеала) в отношении фактической точности, управляемости и способности не выходить за установленные рамки.

За последние два года мы полностью пересобрали наш стек глубокого обучения и совместно с Azure спроектировали суперкомпьютер с нуля под наши рабочие нагрузки. Год назад мы обучили GPT‑3.5 в качестве первого «тестового заезда» системы. Мы обнаружили и исправили несколько ошибок, а также усовершенствовали наши теоретические основы. В результате процесс обучения GPT‑4 прошел беспрецедентно стабильно (по крайней мере, для нас!), сделав ее первой крупной моделью, чью производительность при обучении мы смогли точно предсказать заранее. Поскольку мы продолжаем уделять особое внимание надежному масштабированию, наша цель — отточить методологию, которая поможет нам все дальше и точнее предсказывать будущие возможности и готовиться к ним заранее, что мы считаем критически важным для безопасности.

Мы открываем возможности текстового ввода GPT‑4 через ChatGPT и API (доступен список ожидания). Чтобы подготовить функцию ввода изображений к более широкому использованию, мы для начала тесно сотрудничаем с одним партнером. Мы также открываем исходный код OpenAI Evals — нашего фреймворка для автоматической оценки производительности моделей ИИ, чтобы каждый мог сообщать о недостатках наших моделей и помогать направлять их дальнейшее улучшение.

Возможности

В непринужденной беседе разница между GPT‑3.5 и GPT‑4 может быть едва уловимой. Различия проявляются тогда, когда сложность задачи достигает определенного порога: GPT‑4 работает надежнее, креативнее и способна обрабатывать гораздо более тонкие и сложные инструкции, чем GPT‑3.5.

Чтобы понять разницу между двумя моделями, мы протестировали их на различных бенчмарках, включая симуляции экзаменов, изначально разработанных для людей. Мы использовали самые свежие общедоступные тесты (в случае олимпиад и вопросов с открытым ответом AP) или приобретали издания пробных экзаменов за 2022–2023 годы. Какое-либо специальное обучение для этих экзаменов не проводилось. Лишь небольшая часть задач из экзаменов встречалась модели в процессе обучения, но мы считаем результаты репрезентативными — подробности см. в нашем техническом отчете.

внутренняя ссылка 1

Мы также оценили GPT‑4 на традиционных бенчмарках, предназначенных для моделей машинного обучения. GPT‑4 значительно превосходит существующие большие языковые модели, а также большинство моделей современного уровня (SOTA), в число которых могут входить решения со специфической доработкой под бенчмарки или дополнительными протоколами обучения:

Многие существующие бенчмарки для МО написаны на английском языке. Чтобы получить предварительное представление о возможностях модели на других языках, мы перевели бенчмарк MMLU (набор из 14 000 задач с множественным выбором, охватывающий 57 предметов) на различные языки с помощью Azure Translate (см. Приложение). В 24 из 26 протестированных языков GPT‑4 превосходит показатели GPT‑3.5 и других языковых моделей (Chinchilla, PaLM) на английском языке, в том числе для языков с низким объемом ресурсов, таких как латышский, валлийский и суахили:

Мы также используем GPT‑4 внутри компании, что оказывает колоссальное влияние на такие направления, как поддержка, продажи, модерация контента и программирование. Мы задействуем модель для помощи людям в оценке результатов работы ИИ, запуская тем самым второй этап нашей стратегии согласования.

Визуальные входы

GPT‑4 может принимать на вход запросы, состоящие из текста и изображений, что — аналогично текстовому режиму — позволяет пользователю задавать любые задачи в области компьютерного зрения или обработки языка. В частности, модель генерирует текстовые выводы (естественный язык, код и т. д.) на основе входных данных, представляющих собой чередующиеся текст и изображения. В самых разных областях — включая документы с текстом и фотографиями, диаграммы или скриншоты — GPT‑4 демонстрирует возможности, схожие с теми, что проявляются при работе только с текстом. Более того, модель может быть усилена методами инференса (test-time techniques), разработанными для чисто текстовых языковых моделей, включая few-shot промптинг и цепочки рассуждений (chain-of-thought). Возможность ввода изображений пока находится в режиме исследовательской предварительной версии и недоступна широкой публике.

Мы даем предварительный обзор производительности GPT‑4, оценивая ее на ограниченном наборе стандартных академических визуальных бенчмарков. Однако эти цифры не полностью отражают весь спектр ее возможностей, поскольку мы постоянно открываем новые и увлекательные задачи, с которыми модель способна справляться. В ближайшем будущем мы планируем опубликовать дополнительные аналитические материалы, показатели оценки, а также результаты глубокого исследования влияния методов, применяемых во время инференса.

внутренняя сноскаA

Управляемость (Steerability)

Мы работали над каждым аспектом плана, изложенного в нашей публикации об определении поведения систем ИИ, включая управляемость. В отличие от классической личности ChatGPT с фиксированной многословностью, тоном и стилем, разработчики (а вскоре и пользователи ChatGPT) теперь могут задавать стиль и задачи своего ИИ, описывая соответствующие указания в «системном» сообщении (system message). Системные сообщения позволяют пользователям API существенно настраивать взаимодействие со своими клиентами в определенных пределах. Мы продолжим вносить улучшения в этой области (и в частности понимаем, что системные сообщения — это самый простой способ «взломать» текущую модель, то есть соблюдение заданных границ неидеально), но мы призываем вас попробовать эту функцию и поделиться своими впечатлениями.

Ограничения

Несмотря на свои возможности, GPT‑4 имеет те же ограничения, что и предыдущие модели GPT. Самое главное — она все еще не полностью надежна («галлюцинирует» факты и допускает логические ошибки). К результатам работы языковых моделей следует относиться с большой осторожностью, особенно в контекстах с высокими ставками, подбирая конкретный протокол (например, проверку человеком, подкрепление дополнительным контекстом или полное исключение сценариев с высокими рисками), который соответствует требованиям конкретного варианта использования.

Хотя это по-прежнему реальная проблема, GPT‑4 значительно сокращает количество галлюцинаций по сравнению с предыдущими моделями (которые сами по себе совершенствовались с каждой итерацией). GPT‑4 набирает на 40% больше баллов, чем наша последняя версия GPT‑3.5, в ходе внутренних состязательных оценок фактической точности:

Мы добились прогресса на внешних бенчмарках, таких как TruthfulQA, который проверяет способность модели отличать факты от специально подобранного состязательного набора неверных утверждений. Эти вопросы сопровождаются фактически неверными ответами, которые выглядят статистически привлекательными.

Базовая модель GPT‑4 справляется с этой задачей лишь немного лучше, чем GPT‑3.5; однако после пост-обучения методом RLHF (с применением того же процесса, который мы использовали для GPT‑3.5) между ними образуется огромный разрыв. Если рассмотреть некоторые примеры ниже, GPT‑4 успешно сопротивляется выбору распространенных заблуждений (например, что старого пса нельзя научить новым фокусам), однако она все еще может упускать из виду мелкие детали (Элвис Пресли не был сыном актера).

В результатах работы модели могут присутствовать различные предвзятости (скидки на мнения/стереотипы) — мы добились прогресса в их устранении, но предстоит сделать еще многое. Согласно нашему недавнему блог-посту, мы стремимся к тому, чтобы создаваемые нами системы ИИ обладали разумным по умолчанию поведением, отражающим ценности широкого круга пользователей, позволяли настраивать эти системы в широких пределах и собирали отзывы общественности о том, какими должны быть эти границы.

GPT‑4 в целом не обладает знаниями о событиях, произошедших после завершения большей части ее обучающей выборки (сентябрь 2021 г.), и не учится на собственном опыте. Она может иногда совершать простые логические ошибки, которые кажутся несоразмерными ее компетентности в стольких областях, или излишне доверчиво принимать очевидные ложные утверждения от пользователя. А порой она может оступаться на сложных проблемах точно так же, как это делают люди, например, допуская уязвимости безопасности в создаваемом ею коде.

GPT‑4 также может с уверенностью ошибаться в своих прогнозах, не утруждая себя перепроверкой работы в тех случаях, когда высока вероятность совершить ошибку. Интересно, что базовая предобученная модель обладает высокой степенью откалиброванности (ее прогнозируемая уверенность в ответе в целом соответствует вероятности того, что он верен). Однако в ходе нашего текущего процесса пост-обучения эта калибровка ухудшается.

Риски и меры противодействия

Мы итерировали GPT‑4 с самого начала обучения, чтобы сделать ее более безопасной и согласованной; эти усилия включали отбор и фильтрацию данных предварительного обучения, оценки и привлечение экспертов, улучшение безопасности модели, а также мониторинг и принудительное исполнение правил.

GPT‑4 несет в себе те же риски, что и предыдущие модели, такие как генерация вредоносных советов, ошибочного кода или неточной информации. Тем не менее, расширенные возможности GPT‑4 порождают новые области рисков. Чтобы оценить масштаб этих рисков, мы привлекли более 50 экспертов из таких областей, как риски согласования ИИ, кибербезопасность, биологические риски, доверие и безопасность, а также международная безопасность, для состязательного тестирования модели. Их выводы напрямую позволили нам протестировать поведение модели в зонах высокого риска, для оценки которых требуется глубокая экспертиза. Отзывы и данные, полученные от этих экспертов, легли в основу наших мер по снижению рисков и улучшению модели; например, мы собрали дополнительные данные, чтобы повысить способность GPT‑4 отклонять запросы на синтез опасных химических веществ.

GPT‑4 включает в себя дополнительный сигнал вознаграждения за безопасность во время обучения RLHF, направленный на сокращение числа вредоносных ответов (согласно нашим правилам использования) путем обучения модели отказывать на запросы подобного контента. Награда выдается классификатором GPT‑4 (работающим в режиме zero-shot), который оценивает границы безопасности и стиль завершения для запросов, связанных с безопасностью. Чтобы предотвратить отказ модели на правомерные запросы, мы собираем разнообразный набор данных из различных источников (например, размеченные производственные данные, «красное тестирование» людьми, сгенерированные моделью промпты) и применяем сигнал вознаграждения за безопасность (с положительным или отрицательным значением) как к разрешенным, так и к запрещенным категориям. 

Наши меры по снижению рисков существенно улучшили многие свойства безопасности GPT‑4 по сравнению с GPT‑3.5. Мы снизили склонность модели отвечать на запросы недопустимого контента на 82% по сравнению с GPT‑3.5, а на чувствительные запросы (например, медицинские советы и причинение вреда себе) GPT‑4 отвечает в соответствии с нашими правилами на 29% чаще.

В целом, наши интервенции на уровне моделей увеличивают сложность провокации деструктивного поведения, однако добиться этого всё ещё возможно. Кроме того, по-прежнему существуют способы «взлома» (jailbreak), позволяющие генерировать контент, который нарушает наши правила использования. По мере того как «риск на один токен» систем ИИ возрастает, критически важным станет достижение чрезвычайно высокой степени надежности таких интервенций; на данном этапе важно дополнять эти ограничения методами безопасности на этапе развертывания, такими как мониторинг злоупотреблений.

GPT‑4 и последующие модели обладают потенциалом существенно повлиять на общество как в положительном, так и в отрицательном ключе. Мы сотрудничаем со сторонними исследователями, чтобы улучшить понимание и оценку возможных последствий, а также разработать методы оценки опасных возможностей, которые могут проявиться в будущих системах. Вскоре мы поделится дополнительными соображениями о потенциальном социальном и экономическом влиянии GPT‑4 и других систем ИИ.

Процесс обучения

Как и предыдущие модели GPT, базовая модель GPT‑4 обучалась прогнозировать следующее слово в документе с использованием общедоступных данных (таких как данные из интернета), а также лицензированных нами данных. Этот массив данных представляет собой корпус веб-масштаба, включающий правильные и неправильные решения математических задач, слабое и сильное рассуждение, самопротиворечивые и согласованные утверждения, а также отражающий огромное разнообразие идеологем и идей.

Поэтому при получении запроса базовая модель может отвечать самыми разными способами, которые могут быть далеки от намерений пользователя. Чтобы привести её поведение в соответствие с намерениями пользователя в рамках заданных ограничений, мы дорабатываем модель методом обучения с подкреплением на основе отзывов людей (RLHF).

Стоит отметить, что возможности модели формируются преимущественно в процессе предварительного обучения — RLHF не повышает результаты сдачи экзаменов (без целенаправленных усилий этот показатель даже ухудшается). Однако управление моделью обеспечивается этапом постобучения: базовой модели требуется промт-инжиниринг хотя бы для того, чтобы понимать, что ей следует отвечать на вопросы.

Предсказуемое масштабирование

Большая часть работы над проектом GPT‑4 была сосредоточена на создании стека глубокого обучения с предсказуемым масштабированием. Главная причина заключается в том, что для столь масштабных обучающих прогонов, как у GPT‑4, проведение обширной настройки под конкретную модель нецелесообразно. Мы разработали инфраструктуру и оптимизацию, демонстрирующие очень предсказуемое поведение при различных масштабах. Чтобы проверить это масштабирование, мы заранее точно спрогнозировали финальные потери (loss) GPT‑4 на нашей внутренней кодовой базе (не входящей в обучающий набор), экстраполируя данные моделей, обученных по той же методологии, но с использованием в 10 000 раз меньших вычислительных ресурсов:

Теперь, когда мы можем точно прогнозировать метрику, оптимизируемую в процессе обучения (потери), мы начинаем разрабатывать методологию предсказания более интерпретируемых метрик. Например, мы успешно спрогнозировали процент успешных прохождений на подмножестве датасета HumanEval, выполнив экстраполяцию на основе моделей, использовавших в 1000 раз меньше вычислений:

Некоторые возможности по-прежнему трудно предсказать. Например, конкурс Inverse Scaling Prize был направлен на поиск метрики, которая ухудшается по мере роста вычислительной мощности модели, и игнорирование ретроспективных данных (hindsight neglect) стало одним из победителей. Точно так же, как и в другом недавнем результате, GPT‑4 меняет эту тенденцию на противоположную:

Мы считаем, что точное прогнозирование будущих возможностей машинного обучения является важной составляющей безопасности, которой уделяется незаслуженно мало внимания по сравнению с ее потенциальным влиянием (хотя нас воодушевляют усилия ряда организаций). Мы наращиваем усилия по разработке методов, которые предоставят обществу более качественные ориентиры относительно того, чего ожидать от будущих систем, и надеемся, что это станет общей целью для всего сообщества.

OpenAI Evals

Мы открываем исходный код OpenAI Evals — нашего программного фреймворка для создания и запуска бенчмарков с целью оценки таких моделей, как GPT‑4, с возможностью поочередного анализа их производительности по конкретным примерам. Мы используем Evals для управления процессом разработки моделей (как для выявления недостатков, так и для предотвращения регрессий), а наши пользователи могут применять его для отслеживания производительности по мере выхода новых версий моделей (которые теперь будут выпускаться регулярно) и развития интеграций продуктов. Например, Stripe использовала Evals в дополнение к экспертной оценке для измерения точности своего инструмента для работы с документацией на базе GPT.

Поскольку весь код имеет открытый исходный код, Evals поддерживает написание новых классов для реализации пользовательской логики оценки. Однако, судя по нашему опыту, многие бенчмарки соответствуют одному из нескольких «шаблонов», поэтому мы также включили шаблоны, которые оказались наиболее полезными внутри компании (включая шаблон для «оценки, выполняемой самой моделью» — мы выяснили, что GPT‑4 неожиданно хорошо справляется с проверкой собственной работы). Как правило, наиболее эффективным способом создания новой оценки будет инстанцирование одного из этих шаблонов с одновременным предоставлением данных. Мы с нетерпением ждем возможности увидеть, что другие смогут создать с помощью этих шаблонов и Evals в целом.

Мы надеемся, что Evals станет инструментом для обмена бенчмарками и краудсорсинга, охватывающим максимально широкий спектр сценариев сбоев и сложных задач. В качестве примера мы создали оценку логических задач, которая содержит десять промтов, на которых GPT‑4 терпит неудачу. Evals также совместим с реализацией существующих бенчмарков; мы включили несколько блокнотов (notebooks), реализующих академические бенчмарки, а также несколько вариантов интеграции (небольших подмножеств) CoQA в качестве примера.

Мы приглашаем всех использовать Evals для тестирования наших моделей и отправки наиболее интересных примеров. Мы верим, что Evals станет неотъемлемой частью процесса использования наших моделей и создания надстроек над ними, и приветствуем прямой вклад, вопросы и отзывы.

ChatGPT Plus

Подписчики ChatGPT Plus получат доступ к GPT‑4 на сайте chatgpt.com с лимитом использования. Мы будем корректировать точные лимиты в зависимости от спроса и реальной производительности системы, но ожидаем сильных ограничений по пропускной способности (хотя в предстоящие месяцы мы будем масштабировать и оптимизировать ресурсы).

В зависимости от характера трафика мы можем ввести новый уровень подписки для более интенсивного использования GPT‑4; кроме того, мы надеемся в какой-то момент предложить определенное количество бесплатных запросов к GPT‑4, чтобы пользователи без подписки также могли попробовать ее в деле.

API

Чтобы получить доступ к API GPT‑4 (который использует тот же ChatCompletions API, что и gpt-3.5-turbo), пожалуйста, запишитесь в лист ожидания. Мы начнем приглашать некоторых разработчиков уже сегодня и будем постепенно масштабировать доступ, чтобы сбалансировать пропускную способность и спрос. Если вы являетесь исследователем, изучающим влияние ИИ на общество или вопросы выравнивания ИИ, вы также можете подать заявку на получение льготного доступа через нашу программу доступа для исследователей.

Получив доступ, вы сможете отправлять текстовые запросы к модели gpt-4 (ввод изображений пока находится на стадии ограниченной альфы-версии). Мы будем автоматически обновлять ее до рекомендуемой стабильной модели по мере выпуска новых версий (вы можете зафиксировать текущую версию, вызвав gpt-4–0314, поддержка которой продлится до 14 июня). Стоимость составляет $0,03 за 1 тыс. токенов промта и $0,06 за 1 тыс. токенов генерации. Лимиты по умолчанию составляют 40 тыс. токенов в минуту и 200 запросов в минуту.

Модель gpt-4 имеет длину контекста 8 192 токена. Мы также предоставляем ограниченный доступ к версии gpt-4–32k с контекстом на 32 768 токенов (около 50 страниц текста), которая также будет автоматически обновляться со временем (текущая версия gpt-4–32k-0314 поддерживается до 14 июня). Стоимость составляет $0,06 за 1 тыс. токенов промта и $0,12 за 1 тыс. токенов генерации. Мы продолжаем улучшать качество работы модели с длинным контекстом и будем рады вашим отзывам о том, как она справляется с вашими задачами. Мы обрабатываем запросы для движков 8K и 32K с разной скоростью в зависимости от пропускной способности, поэтому доступ к ним может открыться в разное время.

Заключение

Мы с нетерпением ждем момента, когда GPT‑4 станет ценным инструментом, улучшающим жизнь людей за счет работы множества приложений. Нам предстоит проделать еще много работы, и мы надеемся на совершенствование этой модели благодаря совместным усилиям сообщества, которое строит на ее основе, исследует ее и вносит свой вклад.

Подробнее: Читать статью / Посмотреть системную карту (system card) / Попробовать в ChatGPT Plus / Попробовать в Playground / Пересмотреть демо-трансляцию / Внести вклад в OpenAI Evals

Приложение

Пример вопросов из MMLU, переведенных на другие языки. Обратите внимание, что мы используем постоянные токены вариантов ответа (A–D):

Сноски

  1. A

    Мы оцениваем этот бенчмарк с помощью промтинга Chain-Of-Thought (по цепочке расссуждений) с 4 примерами из обучающего набора в контексте. Конкретный промт был настроен на валидационном наборе.

Ссылки

  1. 1

    P. Arredondo (Casetext/Stanford CodeX), D. Katz (Stanford CodeX), M. Bommarito (Stanford CodeX), S. Gao (Casetext). Дальнейший анализ доступен в документе.

Автор

OpenAI

Благодарности

Посмотреть вклад в разработку GPT-4

Полный текст статьи читайте на OpenAI