Представляем ChatGPT
Эта публикация представила ChatGPT в 2022 году. С тех пор ChatGPT значительно эволюционировал.
Узнать больше о ChatGPT:
Мы обучили модель под названием ChatGPT, которая взаимодействует в диалоговом режиме. Такой формат диалога позволяет ChatGPT отвечать на дополнительные вопросы, признавать свои ошибки, оспаривать неверные предпосылки и отклонять неуместные запросы.
ChatGPT — это родственная модель по отношению к InstructGPT, которая обучена следовать инструкциям в подсказке (промпте) и выдавать подробный ответ.
Мы рады представить ChatGPT, чтобы получить отзывы пользователей и узнать о его сильных и слабых сторонах. Во время исследовательского превью использование ChatGPT является бесплатным. Попробуйте его прямо сейчас на сайте chatgpt.com.
Примеры
Методы
Мы обучили эту модель с использованием обучения с подкреплением на основе отзывов человека (RLHF), применяя те же методы, что и для InstructGPT, но с небольшими различиями в настройке сбора данных. Мы обучили исходную модель с помощью контролируемой доработки (supervised fine-tuning): ИИ-тренеры из числа людей составляли диалоги, в которых они играли обе роли — пользователя и ИИ-ассистента. Мы предоставили тренерам доступ к предложениям, написанным моделью, чтобы помочь им формулировать ответы. Мы объединили этот новый набор данных диалогов с набором данных InstructGPT, который мы преобразовали в формат диалога.
Чтобы создать модель вознаграждения для обучения с подкреплением, нам нужно было собрать данные для сравнения, состоящие из двух или более ответов модели, ранжированных по качеству. Для сбора этих данных мы использовали диалоги, которые ИИ-тренеры вели с чат-ботом. Мы случайным образом выбирали сообщение, написанное моделью, делали выборку из нескольких альтернативных вариантов завершения и просили ИИ-тренеров ранжировать их. Используя эти модели вознаграждения, мы можем доработать модель с помощью метода оптимизации проксимальной политики (Proximal Policy Optimization). Мы выполнили несколько итераций этого процесса.

ChatGPT доработана на основе модели из серии GPT‑3.5, обучение которой завершилось в начале 2022 года. Подробнее о серии 3.5 можно узнать здесь. ChatGPT и GPT‑3.5 обучались на суперкомпьютерной инфраструктуре Azure AI.
Ограничения
- ChatGPT иногда выдает правдоподобно звучащие, но неверные или бессмысленные ответы. Исправление этой проблемы представляет сложность, поскольку: (1) во время обучения с подкреплением в настоящее время отсутствует источник достоверных данных (ground truth); (2) обучение модели большей осторожности приводит к тому, что она отказывается отвечать на вопросы, на которые способна ответить правильно; и (3) обучение с учителем вводит модель в заблуждение, так как идеальный ответ зависит от того, что известно модели, а не от того, что известно человеку-демонстратору.
- ChatGPT чувствителен к изменениям формулировки входных данных или к многократному использованию одного и того же промпта. Например, при определенной формулировке вопроса модель может заявить, что не знает ответа, но при небольшой перефразировке — ответить правильно.
- Модель часто бывает избыточно многословной и злоупотребляет определенными фразами, например, постоянно напоминает, что она является языковой моделью, обученной OpenAI. Эти проблемы обусловлены предвзятостью в обучающих данных (тренеры предпочитают более длинные ответы, которые выглядят более исчерпывающими) и хорошо известными проблемами избыточной оптимизации.,
- В идеале модель должна задавать уточняющие вопросы, когда пользователь отправляет двусмысленный запрос. Вместо этого наши текущие модели обычно угадывают намерения пользователя.
- Хотя мы приложили усилия, чтобы заставить модель отказывать на неуместные запросы, она иногда отвечает на вредоносные инструкции или демонстрирует предвзятое поведение. Мы используем Moderation API для предупреждения или блокировки определенных типов небезопасного контента, однако на данный момент мы ожидаем наличия ложноположительных и ложноотрицательных срабатываний. Мы с нетерпением ждем отзывов пользователей, чтобы продолжить работу по совершенствованию этой системы.
Итеративное развертывание
Сегодняшний исследовательский релиз ChatGPT — это очередной шаг в рамках итеративного развертывания компанией OpenAI все более безопасных и полезных систем ИИ. Множество уроков, извлеченных из внедрения более ранних моделей вроде GPT‑3 и Codex, легло в основу мер безопасности для этого релиза, включая значительное сокращение числа вредных и недостоверных ответов, достигнутое за счет использования обучения с подкреплением на основе отзывов человека (RLHF).
Мы понимаем, что сохраняется множество упомянутых выше ограничений, и планируем регулярно выпускать обновления моделей для совершенствования в этих областях. Но мы также надеемся, что, предоставив доступный интерфейс для ChatGPT, мы получим ценные отзывы от пользователей о проблемах, о которых еще не знали.
Мы призываем пользователей оставлять отзывы о проблемных ответах моделей через интерфейс, а также о ложноположительных и ложноотрицательных срабатываниях внешнего фильтра контента, который также является частью интерфейса. Нас особенно интересуют отзывы о вредоносных результатах работы модели, которые могут возникать в реальных условиях без целена попытки взлома (неагрессивных условиях), а также отзывы, помогающие нам выявлять и понимать новые риски и возможные способы их минимизации. Вы можете принять участие в конкурсе отзывов о ChatGPT
Мы рады применить опыт, полученный в ходе этого релиза, при развертывании более мощных систем — точно так же, как прошлые запуски помогли подготовить этот.
Сноски
Источники
Автор
Благодарности
John Schulman, Barret Zoph, Christina Kim, Jacob Hilton, Jacob Menick, Jiayi Weng, Juan Felipe Ceron Uribe, Liam Fedus, Luke Metz, Michael Pokorny, Rapha Gontijo Lopes, Shengjia Zhao, Arun Vijayvergiya, Eric Sigler, Adam Perelman, Chelsea Voss, Mike Heaton, Joel Parish, Dave Cummings, Rajeev Nayak, Valerie Balcom, David Schnurr, Tomer Kaftan, Chris Hallacy, Nicholas Turley, Noah Deutsch, Vik Goel, Jonathan Ward, Aris Konstantinidis, Wojciech Zaremba, Long Ouyang, Leonard Bogdonoff, Joshua Gross, David Medina, Sarah Yoo, Teddy Lee, Ryan Lowe, Dan Mossing, Joost Huizinga, Roger Jiang, Carroll Wainwright, Diogo Almeida, Steph Lin, Marvin Zhang, Kai Xiao, Katarina Slama, Steven Bills, Alex Gray, Jan Leike, Jakub Pachocki, Phil Tillet, Shantanu Jain, Greg Brockman, Nick Ryder, Alex Paino, Qiming Yuan, Clemens Winter, Ben Wang, Mo Bavarian, Igor Babuschkin, Szymon Sidor, Ingmar Kanitscheider, Mikhail Pavlov, Matthias Plappert, Nik Tezak, Heewoo Jun, William Zhuk, Vitchyr Pong, Lukasz Kaiser, Jerry Tworek, Andrew Carr, Lilian Weng, Sandhini Agarwal, Karl Cobbe, Vineet Kosaraju, Alethea Power, Stanislas Polu, Jesse Han, Raul Puri, Shawn Jain, Benjamin Chess, Christian Gibson, Oleg Boiko, Emy Parparita, Amin Tootoonchian, Kyle Kosic, Christopher Hesse
Полный текст статьи читайте на OpenAI
