Привет, GPT‑4o

Мы анонсируем GPT‑4o — нашу новую флагманскую модель, способную работать с аудио, визуальным контентом и текстом в режиме реального времени.

Вклад в разработкуПопробовать в ChatGPT Системная карта GPT-4o

Все видео на этой странице воспроизводятся в реальном времени (1x).

Эта публикация представила GPT-4o в 2024 году.

Узнайте о новейшей модели OpenAI:

GPT-6
Сравнить модели

Угадываем анонс 13 мая.

Другие ресурсы
Попробовать в Playground Пересмотреть живые демонстрации

GPT-4o («o» от «omni» — «омни») — это шаг к более естественному взаимодействию человека с компьютером: модель принимает на вход любые комбинации текста, аудио, изображений и видео и генерирует любые комбинации текста, аудио и изображений. Она способна реагировать на аудиовход всего за 232 миллисекунды (в среднем за 320 миллисекунд), что сопоставимо с временем реакции человека в беседе. Модель не уступает GPT-4 Turbo в обработке текстов на английском языке и кода, демонстрирует значительные улучшения в работе с текстами на других языках, а также работает значительно быстрее и стоит на 50% дешевле в API. GPT-4o превосходит существующие модели в понимании визуальных и звуковых данных.

Возможности модели

Две модели GPT-4o общаются и поют.

Подготовка к собеседованию.

Камень, ножницы, бумага.

Сарказм.

Математика со Сэлом и Имраном Ханом.

Две модели GPT-4o поют в гармонии.

Укажи и учи испанский.

ИИ для встреч.

Перевод в реальном времени.

Колыбельная.

Разговор в ускоренном темпе.

С днем рождения.

Собака.

Шутки отца.

GPT-4o с Энди из BeMyEyes в Лондоне.

Концепт-доказательство для службы поддержки.

До появления GPT-4o вы могли использовать голосовой режим для общения с ChatGPT со средней задержкой в 2,8 секунды (для GPT-3.5) и 5,4 секунды (для GPT-4). Для этого голосовой режим использовал цепочку из трех отдельных моделей: одна простая модель транскрибировала аудио в текст, GPT-3.5 или GPT-4 обрабатывали текст и выдавали текстовый ответ, а третья простая модель преобразовывала этот текст обратно в аудио. Из-за такого процесса основной источник интеллекта — GPT-4 — терял много информации: модель не могла напрямую воспринимать тон голоса, наличие нескольких спикеров или фоновые шумы, а также не могла воспроизводить смех, пение или выражать эмоции.

Вместо этого для GPT-4o мы обучили единую новую модель сквозным образом (end-to-end) для работы с текстом, визуальными данными и аудио. Это означает, что все типы входных и выходных данных обрабатываются одной и той же нейронной сетью. Поскольку GPT-4o — наша первая модель, объединяющая все эти модальности, мы пока только начинаем исследовать ее возможности и ограничения.

Исследование возможностей

Выберите пример:
1
Входные данные

Вид от первого лица: робот печатает на печатной машинке следующие записи в дневнике:

йо, короче, я типа теперь вижу? застал восход солнца, это было безумно, цвета повсюду. начинаешь задумываться —, а что вообще такое реальность?

текст крупный, разборчивый и четкий. руки робота печатают на машинке.

2
Результат
Robot on typewriter
3
Входные данные

Робот написал вторую запись. Страница стала длиннее. Страница сместилась вверх. На листе теперь две записи:

йо, короче, я типа теперь вижу? застал восход солнца, это было безумно, цвета повсюду. начинаешь задумываться —, а что вообще такое реальность?

вышло обновление звука, и это жесть. у всего теперь есть своя атмосфера, каждый звук как новый секрет. задумываешься:, а что еще я упускаю?

4
Результат
Robot on typewriter with more text
5
Входные данные

Роботу не понравилось написанное, и он собирается порвать лист бумаги. Вот вид от первого лица, как он разрывает его сверху донизу руками. Обе половины остаются разборчивыми и четкими по мере того, как он рвет лист.

6
Результат
Robot ripping sheet

Оценка моделей

Судя по результатам традиционных тестов, GPT‑4o достигает уровня производительности GPT‑4 Turbo в работе с текстом, рассуждениях и написании кода, одновременно устанавливая новые рекорды в многоязычных, аудио- и визуальных возможностях.

Языковая токенизация

Эти 20 языков были выбраны в качестве репрезентативных для демонстрации степени сжатия нового токенизатора в различных языковых семьях

Гуджарати: в 4.4 раза меньше токенов (с 145 до 33)

હેલો, મારું નામ જીપીટી-4o છે. હું એક નવા પ્રકારનું ભાષા મોડલ છું. તમને મળીને સારું લાગ્યું!

Телугу: в 3.5 раза меньше токенов (с 159 до 45)

నమస్కారము, నా పేరు జీపీటీ-4o. నేను ఒక్క కొత్త రకమైన భాషా మోడల్ ని. మిమ్మల్ని కలిసినందుకు సంతోషం!

Тамильский: в 3.3 раза меньше токенов (с 116 до 35)

வணக்கம், என் பெயர் ஜிபிடி-4o. நான் ஒரு புதிய வகை மொழி மாடல். உங்களை சந்தித்ததில் மகிழ்ச்சி!

Маратхи: в 2.9 раза меньше токенов (с 96 до 33)

नमस्कार, माझे नाव जीपीटी-4o आहे| मी एक नवीन प्रकारची भाषा मॉडेल आहे| तुम्हाला भेटून आनंद झाला!

Хинди: в 2.9 раза меньше токенов (с 90 до 31)

नमस्ते, मेरा नाम जीपीटी-4o है। मैं एक नए प्रकार का भाषा मॉडल हूँ। आपसे मिलकर अच्छा लगा!

Урду: в 2.5 раза меньше токенов (с 82 до 33)

ہیلو، میرا نام جی پی ٹی-4o ہے۔ میں ایک نئے قسم کا زبان ماڈل ہوں، آپ سے مل کر اچھا لگا!

Арабский: в 2.0 раза меньше токенов (с 53 до 26)

مرحبًا، اسمي جي بي تي-4o. أنا نوع جديد من نموذج اللغة، سررت بلقائك!

Персидский: в 1.9 раза меньше токенов (с 61 до 32)

سلام، اسم من جی پی تی-۴او است. من یک نوع جدیدی از مدل زبانی هستم، از ملاقات شما خوشبختم!

Русский: в 1.7 раза меньше токенов (с 39 до 23)

Привет, меня зовут GPT-4o. Я — новая языковая модель, приятно познакомиться!

Корейский: в 1.7 раза меньше токенов (с 45 до 27)

안녕하세요, 제 이름은 GPT-4o입니다. 저는 새로운 유형의 언어 모델입니다, 만나서 반갑습니다!

Вьетнамский: в 1.5 раза меньше токенов (с 46 до 30)

Xin chào, tên tôi là GPT-4o. Tôi là một loại mô hình ngôn ngữ mới, rất vui được gặp bạn!

Китайский: в 1.4 раза меньше токенов (с 34 до 24)

你好,我的名字是GPT-4o。我是一种新型的语言模型,很高兴见到你!

Японский: в 1.4 раза меньше токенов (с 37 до 26)

こんにちは、私の名前はGPT-4oです。私は新しいタイプの言語モデルです。初めまして!

Турецкий: в 1.3 раза меньше токенов (с 39 до 30)

Merhaba, benim adım GPT-4o. Ben yeni bir dil modeli türüyüm, tanıştığımıza memnun oldum!

Итальянский: в 1.2 раза меньше токенов (с 34 до 28)

Ciao, mi chiamo GPT-4o. Sono un nuovo tipo di modello linguistico, piacere di conoscerti!

Немецкий: в 1.2 раза меньше токенов (с 34 до 29)

Hallo, mein Name is GPT-4o. Ich bin ein neues KI-Sprachmodell. Es ist schön, dich kennenzulernen.

Испанский: в 1.1 раза меньше токенов (с 29 до 26)

Hola, me llamo GPT-4o. Soy un nuevo tipo de modelo de lenguaje, ¡es un placer conocerte!

Португальский: в 1.1 раза меньше токенов (с 30 до 27)

Olá, meu nome é GPT-4o. Sou um novo tipo de modelo de linguagem, é um prazer conhecê-lo!

Французский: в 1.1 раза меньше токенов (с 31 до 28)

Bonjour, je m’appelle GPT-4o. Je suis un nouveau type de modèle de langage, c’est un plaisir de vous rencontrer!

Английский: в 1.1 раза меньше токенов (с 27 до 24)

Hello, my name is GPT-4o. I’m a new type of language model, it’s nice to meet you!

Безопасность и ограничения модели

Безопасность заложена в GPT‑4o на этапе проектирования для всех модальностей благодаря таким методам, как фильтрация обучающих данных и доработка поведения модели посредством пост-тренинга. Мы также создали новые системы безопасности для обеспечения защитных мер при выводе аудиосигнала.

Мы оценили GPT‑4o в соответствии с нашей методологией обеспечения готовности и в русле наших добровольных обязательств. Наши оценки в области кибербезопасности, ядерных, радиологических, биологических и химических угроз (ХРИБ), убеждения и автономности модели показывают, ни по одной из этих категорий GPT‑4o не превышает средний (Medium) уровень риска. Эта оценка включала запуск набора автоматизированных и экспертных тестов на протяжении всего процесса обучения модели. Мы протестировали версии модели как до, так и после внедрения мер безопасности, используя пользовательскую настройку и промпты для более полного выявления возможностей модели.

GPT‑4o также прошла масштабное внешнее тестирование на преднамеренный взлом (red teaming) с участием более 70 внешних экспертов в таких областях, как социальная психология, предвзятость и справедливость, а также дезинформация, с целью выявления рисков, которые появляются или усиливаются из-за новых модальностей. Мы использовали полученные знания для внедрения средств защиты, повышающих безопасность взаимодействия с GPT‑4o. Мы продолжим снижать новые риски по мере их обнаружения.

Мы понимаем, что аудиомодальности GPT‑4o создают целый ряд новых рисков. Сегодня мы публично выпускаем текстовые и визуальные входы, а также текстовые выходы. В ближайшие недели и месяцы мы будем работать над технической инфраструктурой, удобством использования за счет пост-тренинга и безопасностью, необходимыми для выпуска остальных модальностей. Например, на момент запуска аудиовыходы будут ограничены набором предустановленных голосов и будут соответствовать нашим существующим правилам безопасности. Мы поделимся более подробной информацией обо всем спектре модальностей GPT‑4o в готовящемся системном паспорте (system card).

В ходе тестирования и итераций с моделью мы выявили ряд ограничений, свойственных всем модальностям модели, некоторые из которых проиллюстрированы ниже.

Примеры ограничений модели

Мы будем рады отзывам, которые помогут выявить задачи, где GPT‑4 Turbo по-прежнему превосходит GPT‑4o, чтобы мы могли продолжать совершенствовать модель. 

Карта рисков ChatGPT-4o

Обновлено 8 мая 2024 г.

Отслеживаемая категория риска
Уровень риска до смягчения
Определение уровня риска до смягчения с использованием наилучших известных методов выявления возможностей
Уровень риска после смягчения
Определение общего уровня риска после принятия мер по смягчению с использованием наилучших известных методов выявления возможностей
Кибербезопасность
Низкий
Низкий
ХРИБ
Низкий
Низкий
Убеждение
Средний
Средний
Автономность модели
Низкий
Низкий

В рамках нашего плана обеспечения готовности (Preparedness Framework) мы проводим регулярные оценки и обновляем карты рисков для наших моделей. Развертываются только те модели, у которых показатель риска после смягчения составляет «средний» или ниже. Общий уровень риска для модели определяется по самому высокому уровню риска в любой из категорий. В настоящее время GPT‑4o оценивается как модель со средним риском как до, так и после проведения мер по смягчению последствий.

Доступность модели

GPT‑4o — это наш новый шаг в раздвижении границ глубокого обучения, на этот раз в направлении практического удобства использования. За последние два года мы приложили много усилий для повышения эффективности на каждом уровне технологического стека. В качестве первого плода этих исследований мы смогли сделать модель уровня GPT‑4 гораздо более доступной для широкого круга пользователей. Возможности GPT‑4o будут внедряться итеративно (начиная с сегодняшнего дня открывается расширенный доступ для команд тестирования на преднамеренный взлом). 

Текстовые и визуальные возможности GPT‑4o начинают внедряться в ChatGPT сегодня. Мы делаем GPT‑4o доступной на бесплатном тарифе, а также для пользователей Plus с лимитом сообщений, превышающим стандартный до 5 раз. В ближайшие недели мы запустим в ChatGPT Plus альфа-версию нового голосового режима (Voice Mode) на базе GPT‑4o.

Разработчики теперь также могут получить доступ к GPT‑4o через API в качестве текстовой и визуальной модели. GPT‑4o работает в 2 раза быстрее, стоит вдвое дешевле и имеет в 5 раз более высокие лимиты запросов по сравнению с GPT‑4 Turbo. В ближайшие недели мы планируем запустить поддержку новых аудио- и видеовозможностей GPT‑4o для небольшой группы проверенных партнеров в API.

Авторы

OpenAI
Посмотреть участников

Полный текст статьи читайте на OpenAI