Привет, GPT‑4o
Мы анонсируем GPT‑4o — нашу новую флагманскую модель, способную работать с аудио, визуальным контентом и текстом в режиме реального времени.
Все видео на этой странице воспроизводятся в реальном времени (1x).
Эта публикация представила GPT-4o в 2024 году.
Узнайте о новейшей модели OpenAI:
Угадываем анонс 13 мая.
GPT-4o («o» от «omni» — «омни») — это шаг к более естественному взаимодействию человека с компьютером: модель принимает на вход любые комбинации текста, аудио, изображений и видео и генерирует любые комбинации текста, аудио и изображений. Она способна реагировать на аудиовход всего за 232 миллисекунды (в среднем за 320 миллисекунд), что сопоставимо с временем реакции человека в беседе. Модель не уступает GPT-4 Turbo в обработке текстов на английском языке и кода, демонстрирует значительные улучшения в работе с текстами на других языках, а также работает значительно быстрее и стоит на 50% дешевле в API. GPT-4o превосходит существующие модели в понимании визуальных и звуковых данных.
Возможности модели
Две модели GPT-4o общаются и поют.
Подготовка к собеседованию.
Камень, ножницы, бумага.
Сарказм.
Математика со Сэлом и Имраном Ханом.
Две модели GPT-4o поют в гармонии.
Укажи и учи испанский.
ИИ для встреч.
Перевод в реальном времени.
Колыбельная.
Разговор в ускоренном темпе.
С днем рождения.
Собака.
Шутки отца.
GPT-4o с Энди из BeMyEyes в Лондоне.
Концепт-доказательство для службы поддержки.
До появления GPT-4o вы могли использовать голосовой режим для общения с ChatGPT со средней задержкой в 2,8 секунды (для GPT-3.5) и 5,4 секунды (для GPT-4). Для этого голосовой режим использовал цепочку из трех отдельных моделей: одна простая модель транскрибировала аудио в текст, GPT-3.5 или GPT-4 обрабатывали текст и выдавали текстовый ответ, а третья простая модель преобразовывала этот текст обратно в аудио. Из-за такого процесса основной источник интеллекта — GPT-4 — терял много информации: модель не могла напрямую воспринимать тон голоса, наличие нескольких спикеров или фоновые шумы, а также не могла воспроизводить смех, пение или выражать эмоции.
Вместо этого для GPT-4o мы обучили единую новую модель сквозным образом (end-to-end) для работы с текстом, визуальными данными и аудио. Это означает, что все типы входных и выходных данных обрабатываются одной и той же нейронной сетью. Поскольку GPT-4o — наша первая модель, объединяющая все эти модальности, мы пока только начинаем исследовать ее возможности и ограничения.
Исследование возможностей
Вид от первого лица: робот печатает на печатной машинке следующие записи в дневнике:
йо, короче, я типа теперь вижу? застал восход солнца, это было безумно, цвета повсюду. начинаешь задумываться —, а что вообще такое реальность?
текст крупный, разборчивый и четкий. руки робота печатают на машинке.

Робот написал вторую запись. Страница стала длиннее. Страница сместилась вверх. На листе теперь две записи:
йо, короче, я типа теперь вижу? застал восход солнца, это было безумно, цвета повсюду. начинаешь задумываться —, а что вообще такое реальность?
вышло обновление звука, и это жесть. у всего теперь есть своя атмосфера, каждый звук как новый секрет. задумываешься:, а что еще я упускаю?

Роботу не понравилось написанное, и он собирается порвать лист бумаги. Вот вид от первого лица, как он разрывает его сверху донизу руками. Обе половины остаются разборчивыми и четкими по мере того, как он рвет лист.

Оценка моделей
Судя по результатам традиционных тестов, GPT‑4o достигает уровня производительности GPT‑4 Turbo в работе с текстом, рассуждениях и написании кода, одновременно устанавливая новые рекорды в многоязычных, аудио- и визуальных возможностях.
Языковая токенизация
Эти 20 языков были выбраны в качестве репрезентативных для демонстрации степени сжатия нового токенизатора в различных языковых семьях
Гуджарати: в 4.4 раза меньше токенов (с 145 до 33) | હેલો, મારું નામ જીપીટી-4o છે. હું એક નવા પ્રકારનું ભાષા મોડલ છું. તમને મળીને સારું લાગ્યું! |
Телугу: в 3.5 раза меньше токенов (с 159 до 45) | నమస్కారము, నా పేరు జీపీటీ-4o. నేను ఒక్క కొత్త రకమైన భాషా మోడల్ ని. మిమ్మల్ని కలిసినందుకు సంతోషం! |
Тамильский: в 3.3 раза меньше токенов (с 116 до 35) | வணக்கம், என் பெயர் ஜிபிடி-4o. நான் ஒரு புதிய வகை மொழி மாடல். உங்களை சந்தித்ததில் மகிழ்ச்சி! |
Маратхи: в 2.9 раза меньше токенов (с 96 до 33) | नमस्कार, माझे नाव जीपीटी-4o आहे| मी एक नवीन प्रकारची भाषा मॉडेल आहे| तुम्हाला भेटून आनंद झाला! |
Хинди: в 2.9 раза меньше токенов (с 90 до 31) | नमस्ते, मेरा नाम जीपीटी-4o है। मैं एक नए प्रकार का भाषा मॉडल हूँ। आपसे मिलकर अच्छा लगा! |
Урду: в 2.5 раза меньше токенов (с 82 до 33) | ہیلو، میرا نام جی پی ٹی-4o ہے۔ میں ایک نئے قسم کا زبان ماڈل ہوں، آپ سے مل کر اچھا لگا! |
Арабский: в 2.0 раза меньше токенов (с 53 до 26) | مرحبًا، اسمي جي بي تي-4o. أنا نوع جديد من نموذج اللغة، سررت بلقائك! |
Персидский: в 1.9 раза меньше токенов (с 61 до 32) | سلام، اسم من جی پی تی-۴او است. من یک نوع جدیدی از مدل زبانی هستم، از ملاقات شما خوشبختم! |
Русский: в 1.7 раза меньше токенов (с 39 до 23) | Привет, меня зовут GPT-4o. Я — новая языковая модель, приятно познакомиться! |
Корейский: в 1.7 раза меньше токенов (с 45 до 27) | 안녕하세요, 제 이름은 GPT-4o입니다. 저는 새로운 유형의 언어 모델입니다, 만나서 반갑습니다! |
Вьетнамский: в 1.5 раза меньше токенов (с 46 до 30) | Xin chào, tên tôi là GPT-4o. Tôi là một loại mô hình ngôn ngữ mới, rất vui được gặp bạn! |
Китайский: в 1.4 раза меньше токенов (с 34 до 24) | 你好,我的名字是GPT-4o。我是一种新型的语言模型,很高兴见到你! |
Японский: в 1.4 раза меньше токенов (с 37 до 26) | こんにちは、私の名前はGPT-4oです。私は新しいタイプの言語モデルです。初めまして! |
Турецкий: в 1.3 раза меньше токенов (с 39 до 30) | Merhaba, benim adım GPT-4o. Ben yeni bir dil modeli türüyüm, tanıştığımıza memnun oldum! |
Итальянский: в 1.2 раза меньше токенов (с 34 до 28) | Ciao, mi chiamo GPT-4o. Sono un nuovo tipo di modello linguistico, piacere di conoscerti! |
Немецкий: в 1.2 раза меньше токенов (с 34 до 29) | Hallo, mein Name is GPT-4o. Ich bin ein neues KI-Sprachmodell. Es ist schön, dich kennenzulernen. |
Испанский: в 1.1 раза меньше токенов (с 29 до 26) | Hola, me llamo GPT-4o. Soy un nuevo tipo de modelo de lenguaje, ¡es un placer conocerte! |
Португальский: в 1.1 раза меньше токенов (с 30 до 27) | Olá, meu nome é GPT-4o. Sou um novo tipo de modelo de linguagem, é um prazer conhecê-lo! |
Французский: в 1.1 раза меньше токенов (с 31 до 28) | Bonjour, je m’appelle GPT-4o. Je suis un nouveau type de modèle de langage, c’est un plaisir de vous rencontrer! |
Английский: в 1.1 раза меньше токенов (с 27 до 24) | Hello, my name is GPT-4o. I’m a new type of language model, it’s nice to meet you! |
Безопасность и ограничения модели
Безопасность заложена в GPT‑4o на этапе проектирования для всех модальностей благодаря таким методам, как фильтрация обучающих данных и доработка поведения модели посредством пост-тренинга. Мы также создали новые системы безопасности для обеспечения защитных мер при выводе аудиосигнала.
Мы оценили GPT‑4o в соответствии с нашей методологией обеспечения готовности и в русле наших добровольных обязательств. Наши оценки в области кибербезопасности, ядерных, радиологических, биологических и химических угроз (ХРИБ), убеждения и автономности модели показывают, ни по одной из этих категорий GPT‑4o не превышает средний (Medium) уровень риска. Эта оценка включала запуск набора автоматизированных и экспертных тестов на протяжении всего процесса обучения модели. Мы протестировали версии модели как до, так и после внедрения мер безопасности, используя пользовательскую настройку и промпты для более полного выявления возможностей модели.
GPT‑4o также прошла масштабное внешнее тестирование на преднамеренный взлом (red teaming) с участием более 70 внешних экспертов в таких областях, как социальная психология, предвзятость и справедливость, а также дезинформация, с целью выявления рисков, которые появляются или усиливаются из-за новых модальностей. Мы использовали полученные знания для внедрения средств защиты, повышающих безопасность взаимодействия с GPT‑4o. Мы продолжим снижать новые риски по мере их обнаружения.
Мы понимаем, что аудиомодальности GPT‑4o создают целый ряд новых рисков. Сегодня мы публично выпускаем текстовые и визуальные входы, а также текстовые выходы. В ближайшие недели и месяцы мы будем работать над технической инфраструктурой, удобством использования за счет пост-тренинга и безопасностью, необходимыми для выпуска остальных модальностей. Например, на момент запуска аудиовыходы будут ограничены набором предустановленных голосов и будут соответствовать нашим существующим правилам безопасности. Мы поделимся более подробной информацией обо всем спектре модальностей GPT‑4o в готовящемся системном паспорте (system card).
В ходе тестирования и итераций с моделью мы выявили ряд ограничений, свойственных всем модальностям модели, некоторые из которых проиллюстрированы ниже.
Примеры ограничений модели
Мы будем рады отзывам, которые помогут выявить задачи, где GPT‑4 Turbo по-прежнему превосходит GPT‑4o, чтобы мы могли продолжать совершенствовать модель.
Карта рисков ChatGPT-4o
Обновлено 8 мая 2024 г.
В рамках нашего плана обеспечения готовности (Preparedness Framework) мы проводим регулярные оценки и обновляем карты рисков для наших моделей. Развертываются только те модели, у которых показатель риска после смягчения составляет «средний» или ниже. Общий уровень риска для модели определяется по самому высокому уровню риска в любой из категорий. В настоящее время GPT‑4o оценивается как модель со средним риском как до, так и после проведения мер по смягчению последствий.
Доступность модели
GPT‑4o — это наш новый шаг в раздвижении границ глубокого обучения, на этот раз в направлении практического удобства использования. За последние два года мы приложили много усилий для повышения эффективности на каждом уровне технологического стека. В качестве первого плода этих исследований мы смогли сделать модель уровня GPT‑4 гораздо более доступной для широкого круга пользователей. Возможности GPT‑4o будут внедряться итеративно (начиная с сегодняшнего дня открывается расширенный доступ для команд тестирования на преднамеренный взлом).
Текстовые и визуальные возможности GPT‑4o начинают внедряться в ChatGPT сегодня. Мы делаем GPT‑4o доступной на бесплатном тарифе, а также для пользователей Plus с лимитом сообщений, превышающим стандартный до 5 раз. В ближайшие недели мы запустим в ChatGPT Plus альфа-версию нового голосового режима (Voice Mode) на базе GPT‑4o.
Разработчики теперь также могут получить доступ к GPT‑4o через API в качестве текстовой и визуальной модели. GPT‑4o работает в 2 раза быстрее, стоит вдвое дешевле и имеет в 5 раз более высокие лимиты запросов по сравнению с GPT‑4 Turbo. В ближайшие недели мы планируем запустить поддержку новых аудио- и видеовозможностей GPT‑4o для небольшой группы проверенных партнеров в API.
Авторы
Полный текст статьи читайте на OpenAI
