Представляем GPT-Live-1 в API
- GPT-Live-1 одновременно принимает и передаёт речь, учитывает паузы и перебивания, а сложные задачи делегирует бэкенд-моделям и инструментам.
- В связке с GPT-6 Astra модель выполнила 83,6% задач Tau3 с первой попытки против 45,7% у GPT-Realtime-2.1.
- Голосовые сессии стоят $0,05 за минуту с посекундной оплатой; доступны WebRTC, WebSockets, Telephony и SIP.
GPT-Live-1 переносит естественные полнодуплексные голосовые диалоги ChatGPT в API. Модель одновременно слушает и говорит, учитывает паузы, перебивания и короткие реплики подтверждения, а также адаптируется, если разговор меняет направление.
Модель ведёт диалог в реальном времени, передавая более сложные рассуждения и выполнение задач выбранной вами базовой модели, инструментам или агентскому фреймворку.
Эффективность в реальных задачах
В паре с GPT-6 Astra при среднем уровне усилий на рассуждение GPT-Live-1 с первой попытки выполнила 83,6% задач Tau3 против 45,7% у GPT-Realtime-2.1. Tau3 охватывает поддержку в сфере авиаперевозок, розничной торговли и телекоммуникаций.
Та же связка набрала 38,1% в TauBanking, тесте на поиск документов и использование инструментов для работы со счетами.
Дополнительные результаты тестирования-
97,3% в тесте Conversational Dynamics от Artificial Analysis.
-
80,1% по интерактивности в Full Duplex Bench v1.5.
-
Задержка при смене реплик — 0,798 секунды против 1,41 секунды у GPT-Realtime-2.1.
-
Успешность вызова инструментов — 87%, качество ответов — 90% в отдельных оценках Full Duplex Bench v3.
Голоса и функции для производственных приложений
GPT-Live-1 предлагает 12 голосов для общения в реальном времени:
Quartz · Ripple · Vesper · Willow · Stone · Gleam · Meridian · Bossa · Tempo · Beacon · Delta · Cinder
Расширенный выбор охватывает больше акцентов, диалектов и языков. Системные инструкции позволяют задавать тон, темп, манеру речи и поведение в диалоге.
Для производственных приложений модель предоставляет встроенные транскрипции ASR и текст ответов, настройку приоритета ключевых слов, явное определение смены реплик и улучшенную обработку тишины и фонового шума.
Подключайтесь через WebRTC для браузеров, WebSockets для аудио на стороне сервера или Telephony и SIP для телефонных агентов.
Делегирование задач и Codex
Используйте управляемое делегирование через Responses или подключите существующую модель, агента или сервис с помощью делегирования со стороны клиента. Ваше приложение контролирует разрешения и постоянное состояние задачи; прерывание речи не отменяет автоматически работу на стороне сервера.
GPT-Live-1 также можно использовать вместе с Codex SDK. Приложение передаёт контекст диалога в поток Codex, а затем возвращает результат в активную голосовую сессию. Благодаря этому Codex может исследовать репозиторий или выполнять порученную задачу, пока разговор продолжается.
Посмотрите, как интегрировать GPT-Live-1 и Codex
Стоимость
Голосовые сессии стоят 0,05 доллара за минуту; тарификация ведётся посекундно. Использование базовой модели и инструментов оплачивается отдельно.
Читайте публикацию о запуске · Начните работу с GPT-Live
Создаёте приложение на GPT-Live-1? Поделитесь опытом работы с перебиваниями, делегированием и использованием инструментов в производственных приложениях.
Полный текст статьи читайте на OpenAI




