Создавайте более естественные голосовые интерфейсы с помощью GPT‑Live‑1 в API

GPT‑Live‑1 переносит естественные полнодуплексные беседы ChatGPT в API, предоставляя больше возможностей контроля над тем, как голосовые агенты говорят и действуют.
Мы выпускаем GPT‑Live‑1 в API, предоставляя разработчикам мощную естественную голосовую модель для создания приложений с голосовым управлением и бизнес-рабочих процессов. Впервые представленный в ChatGPT, GPT‑Live‑1 способен одновременно слушать и говорить, и, как видно на примере Codex и ChatGPT Work, может перекладывать более глубокие рассуждения и действия на модели и инструменты, с которыми он связан.
В API-релизе GPT‑Live‑1 мы сосредоточились на новых возможностях, позволяющих разработчикам настраивать голосовые интерфейсы под своих пользователей, рабочие процессы и задачи. Ключевое преимущество GPT‑Live‑1 — плавная обработка прерываний — уже приносит пользу бизнесу: по результатам ранних оценок, сервис Speak обнаружил, что GPT‑Live‑1 дает учащимся больше времени на раздумья до того, как языковой репетитор ответит, сократив количество прерываний почти на 80% по сравнению с предыдущими пошаговыми системами.
Ключевые преимущества GPT‑Live‑1 в API:
- Обработка прерываний: Улучшает обработку прерываний с помощью единой модели, которая одновременно анализирует входящий и исходящий аудиопоток, избегая задержек и хрупких точек передачи управления в цепочечных архитектурах STT–LLM–TTS.
- Делегирование рассуждений и вызова инструментов: GPT‑Live‑1 может делегировать рассуждения и вызовы инструментов текстовой бэкенд-модели, такой как GPT‑6 Astra или модель стороннего производителя.
- Тон, темп и стиль: Позволяет разработчикам задавать тон, темп и стиль общения агента через системный промпт.
- Управление тихим контекстом и фоновым шумом: Лучше справляется с фоновым шумом и тишиной, не прерывая разговор и не озвучивая каждый шаг вслух.
- Надежность в долгих сессиях: Улучшает сохранение контекста и качество общения при продолжительных взаимодействиях.
- Поддержка телефонной связи: Позволяет развертывать полнодуплексные голосовые агенты для телефонных звонков — от бронирования столиков в ресторанах до поддержки клиентов.
- Говорите поверх него — естественно. Попросите о помощи, а затем прервите в середине ответа, чтобы изменить вопрос или добавить подробности.
- Берите его с собой. Попробуйте поговорить во время прогулки на улице или при повседневном фоновом шуме и посмотрите, как он подстраивается под вас.
- Сделайте общение непринужденным. Смейтесь, сомневайтесь, используйте короткие подтверждения или ненадолго обратитесь к кому-то рядом, а затем продолжайте беседу.
Это демо имеет ограничение по времени. Используя его, вы соглашаетесь с условиями использования OpenAI и подтверждаете ознакомление с нашей политикой конфиденциальности.
Упростите архитектуру голосового агента и уменьшите голосовую задержку
Традиционные голосовые агенты объединяют преобразование речи в текст, модель рассуждений и преобразование текста в речь. Каждая точка передачи данных добавляет задержку и создает больше возможностей потерять тайминг, контекст или естественный ритм разговора. Разработчикам часто приходится самим координировать эти этапы, включая то, что происходит, когда кто-то прерывает, делает паузу или меняет направление.
GPT‑Live‑1 обрабатывает прослушивание и речь в рамках одной модели, упрощая голосовой уровень. Он может реагировать на прерывания и подтверждения по мере их поступления, одновременно делегируя более глубокие рассуждения бэкенду. Это позволяет продолжать разговор, пока в фоновом режиме выполняются задачи.
»По сравнению с нашей каскадной сборкой, GPT‑Live‑1 упростил нашу кодовую базу на 80% и удалил 23 тыс. строк кода. Это сделало возможным естественное общение с пациентами в реальном времени и высвободило нашу команду для улучшения работы сервиса — от записи на прием до навигации по уходу за больными.»—Тони Стоянов (Tony Stoyanov), соучредитель и технический директор
Разработчики выбирают модели, инструменты и каркас агента, лежащие в основе разговора. Например, они могут объединить GPT‑Live‑1 с такой моделью, как Luna, для выполнения задач с большим объемом данных, таких как планирование или обновление заказов, и использовать модель вроде Astra для сложных клиентских вопросов, требующих рассуждений. Такая гибкость позволяет разработчикам подбирать глубину рассуждений, скорость и стоимость под каждую конкретную задачу.
GPT‑Live‑1 изначально предоставляет стенограммы ASR и текст ответа. Он также обладает отличным пониманием буквенно-цифровых данных и поддерживает смещение ключевых слов. Хотя GPT‑Live‑1 не является пошаговой моделью, он нативно поддерживает определение реплик (turn detection), поэтому разработчики могут продолжать проектировать решения с учетом явных границ диалога.
Оценка преимуществ полного дуплекса
По результатам наших оценок, GPT‑Live‑1 улучшает показатели производительности на бенчмарке Full Duplex Bench на 30 процентных пунктов по сравнению с GPT‑Realtime‑2.1, демонстрируя значительный прирост в задержке смены реплик и интерактивном поведении. В паре с GPT‑6 Astra при среднем уровне рассуждений он также занимает 1-е место на Tau3, который оценивает интеллект передовых голосовых агентов в сквозных задачах.
Оценивает устные задачи клиентского сервиса в сферах авиаперевозок, ритейла и телекоммуникаций. Pass@1 измеряет успешность выполнения задач; в общем результате каждому домену уделяется равный вес.
* Бэкенд GPT Live: Astra (средний).
Оценивает устную поддержку банковских операций с извлечением знаний и использованием инструментов для работы с аккаунтами. Pass@1 представляет собой долю успешно выполненных из 97 задач banking_knowledge.
* Бэкенд GPT Live: Astra (средний).
Оценивает обработку пауз, смену разговорных реплик, прерывания и фоновые реплики слушателя (backchannels).
Проверяет реакцию на фоновую речь, обращение к другому человеку, реплики слушателя и прерывания.
Измеряет, насколько быстро агент начинает ответ после того, как пользователь завершил свою реплику.
Тестирует использование инструментов по устным запросам, содержащим естественные паузы, колебания и самоисправления. Pass@1 оценивает последовательность вызовов инструментов.
* Бэкенд GPT Live: Terra (низкий).
Оценивает устный ответ на запросы с использованием инструментов, содержащие паузы, колебания и самоисправления. Оценивает, насколько точно ответ соответствует эталонному намерению.
* Бэкенд GPT Live: Terra (низкий).
Что говорят клиенты
»Интеграция GPT‑Live‑1 в Yelp Host и Hatch улучшила очередность реплик и точность по сравнению с нашей традиционной голосовой архитектурой. Когда Yelp Host использует GPT‑Live‑1 для ответов на звонки, например при бронировании столиков и заказе еды, мы наблюдаем значительное улучшение показателей обработки вызовов. Кроме того, абоненты стали говорить более полными и естественными предложениями, что говорит о том, что взаимодействие на другом конце провода воспринимается совершенно иначе.»—Алекс Леви (Alex Levy), технический директор
Новые варианты голосов
Разработчикам нужны голоса, которые подходят их продукту и звучат естественно для пользователей. С выходом GPT‑Live‑1 мы расширяем небольшой набор голосов реального времени до более широкого выбора с учетом акцентов, диалектов и языков, предоставляя разработчикам больше возможностей для выбора того, как звучат их ассистенты.
Оцените новые голоса
Мы продолжим расширять выбор голосов и поддержку языков в ближайшие месяцы.
Цены и доступность
Модель GPT‑Live‑1 доступна в API уже сегодня по цене $0.05 за минуту для интерфейсного голосового слоя. Объедините её с бэкенд-моделью и агентской обвязкой, подходящими для вашего продукта, чтобы создать голосовое взаимодействие, масштабируемое под ваши задачи.
Подключение GPT-Live-1 к Codex
1import { Codex } from "@openai/codex-sdk";2
3const thread = new Codex().startThread({4 workingDirectory: "./repo",5 sandboxMode: "read-only",6 approvalPolicy: "never",7});8
9async function answer(live, delegationId, context) {10 const { finalResponse } = await thread.run(11 `Answer the latest question using this repo.12 Reply in two short spoken sentences.\n${context}`13 );14
15 live.send({16 type: "session.commentary.append",17 delegation_id: delegationId,18 content: finalResponse,19 });20}Подключение GPT-Live-1 к Codex. В этом фрагменте показано, как приложение передает контекст беседы в Codex и возвращает его ответ обратно в GPT-Live-1. Настройка соединения и обработка делегирования опущены.
Для получения доступа к индивидуальным голосам свяжитесь с отделом продаж, чтобы узнать подробнее об условиях и процедуре подачи заявки.
Еще один способ создания голосовых рабочих процессов на базе GPT‑Live‑1 — использование OpenAI Presence, платформы, которая задействует модель для голосового взаимодействия в реальном времени. Presence помогает предприятиям внедрять надежные ИИ-агенты, способные отвечать на вопросы, решать проблемы, использовать корпоративные системы, выполнять утвержденные действия и при необходимости переключать пользователей на живых сотрудников. Обратитесь к своему менеджеру по работе с клиентами OpenAI, чтобы узнать больше.
Автор
Полный текст статьи читайте на OpenAI
