Создавайте более естественные голосовые интерфейсы с помощью GPT‑Live‑1 в API

introducing-gpt-live-1-green-seo.png?w=1

GPT‑Live‑1 переносит естественные полнодуплексные беседы ChatGPT в API, предоставляя больше возможностей контроля над тем, как голосовые агенты говорят и действуют.

Мы выпускаем GPT‑Live‑1 в API, предоставляя разработчикам мощную естественную голосовую модель для создания приложений с голосовым управлением и бизнес-рабочих процессов. Впервые представленный в ChatGPT, GPT‑Live‑1 способен одновременно слушать и говорить, и, как видно на примере Codex и ChatGPT Work, может перекладывать более глубокие рассуждения и действия на модели и инструменты, с которыми он связан.

В API-релизе GPT‑Live‑1 мы сосредоточились на новых возможностях, позволяющих разработчикам настраивать голосовые интерфейсы под своих пользователей, рабочие процессы и задачи. Ключевое преимущество GPT‑Live‑1 — плавная обработка прерываний — уже приносит пользу бизнесу: по результатам ранних оценок, сервис Speak обнаружил, что GPT‑Live‑1 дает учащимся больше времени на раздумья до того, как языковой репетитор ответит, сократив количество прерываний почти на 80% по сравнению с предыдущими пошаговыми системами.

Ключевые преимущества GPT‑Live‑1 в API:

  • Обработка прерываний: Улучшает обработку прерываний с помощью единой модели, которая одновременно анализирует входящий и исходящий аудиопоток, избегая задержек и хрупких точек передачи управления в цепочечных архитектурах STT–LLM–TTS.
  • Делегирование рассуждений и вызова инструментов: GPT‑Live‑1 может делегировать рассуждения и вызовы инструментов текстовой бэкенд-модели, такой как GPT‑6 Astra или модель стороннего производителя.
  • Тон, темп и стиль: Позволяет разработчикам задавать тон, темп и стиль общения агента через системный промпт.
  • Управление тихим контекстом и фоновым шумом: Лучше справляется с фоновым шумом и тишиной, не прерывая разговор и не озвучивая каждый шаг вслух.
  • Надежность в долгих сессиях: Улучшает сохранение контекста и качество общения при продолжительных взаимодействиях.
  • Поддержка телефонной связи: Позволяет развертывать полнодуплексные голосовые агенты для телефонных звонков — от бронирования столиков в ресторанах до поддержки клиентов.
Начните сеанс и говорите естественно. Перебивайте, смейтесь, меняйте свое мнение — попробуйте дома или в шумном месте, например в кофейне или на городской улице.
Посмотрите, на что он способен
  • Говорите поверх него — естественно. Попросите о помощи, а затем прервите в середине ответа, чтобы изменить вопрос или добавить подробности.
  • Берите его с собой. Попробуйте поговорить во время прогулки на улице или при повседневном фоновом шуме и посмотрите, как он подстраивается под вас.
  • Сделайте общение непринужденным. Смейтесь, сомневайтесь, используйте короткие подтверждения или ненадолго обратитесь к кому-то рядом, а затем продолжайте беседу.

Это демо имеет ограничение по времени. Используя его, вы соглашаетесь с условиями использования OpenAI и подтверждаете ознакомление с нашей политикой конфиденциальности.

Упростите архитектуру голосового агента и уменьшите голосовую задержку

Традиционные голосовые агенты объединяют преобразование речи в текст, модель рассуждений и преобразование текста в речь. Каждая точка передачи данных добавляет задержку и создает больше возможностей потерять тайминг, контекст или естественный ритм разговора. Разработчикам часто приходится самим координировать эти этапы, включая то, что происходит, когда кто-то прерывает, делает паузу или меняет направление.

GPT‑Live‑1 обрабатывает прослушивание и речь в рамках одной модели, упрощая голосовой уровень. Он может реагировать на прерывания и подтверждения по мере их поступления, одновременно делегируя более глубокие рассуждения бэкенду. Это позволяет продолжать разговор, пока в фоновом режиме выполняются задачи.

»По сравнению с нашей каскадной сборкой, GPT‑Live‑1 упростил нашу кодовую базу на 80% и удалил 23 тыс. строк кода. Это сделало возможным естественное общение с пациентами в реальном времени и высвободило нашу команду для улучшения работы сервиса — от записи на прием до навигации по уходу за больными.»
—Тони Стоянов (Tony Stoyanov), соучредитель и технический директор

Разработчики выбирают модели, инструменты и каркас агента, лежащие в основе разговора. Например, они могут объединить GPT‑Live‑1 с такой моделью, как Luna, для выполнения задач с большим объемом данных, таких как планирование или обновление заказов, и использовать модель вроде Astra для сложных клиентских вопросов, требующих рассуждений. Такая гибкость позволяет разработчикам подбирать глубину рассуждений, скорость и стоимость под каждую конкретную задачу.

GPT‑Live‑1 изначально предоставляет стенограммы ASR и текст ответа. Он также обладает отличным пониманием буквенно-цифровых данных и поддерживает смещение ключевых слов. Хотя GPT‑Live‑1 не является пошаговой моделью, он нативно поддерживает определение реплик (turn detection), поэтому разработчики могут продолжать проектировать решения с учетом явных границ диалога.

Оценка преимуществ полного дуплекса

По результатам наших оценок, GPT‑Live‑1 улучшает показатели производительности на бенчмарке Full Duplex Bench на 30 процентных пунктов по сравнению с GPT‑Realtime‑2.1, демонстрируя значительный прирост в задержке смены реплик и интерактивном поведении. В паре с GPT‑6 Astra при среднем уровне рассуждений он также занимает 1-е место на Tau3, который оценивает интеллект передовых голосовых агентов в сквозных задачах.

Оценивает устные задачи клиентского сервиса в сферах авиаперевозок, ритейла и телекоммуникаций. Pass@1 измеряет успешность выполнения задач; в общем результате каждому домену уделяется равный вес.


* Бэкенд GPT Live: Astra (средний).

Оценивает устную поддержку банковских операций с извлечением знаний и использованием инструментов для работы с аккаунтами. Pass@1 представляет собой долю успешно выполненных из 97 задач banking_knowledge.


* Бэкенд GPT Live: Astra (средний).

Оценивает обработку пауз, смену разговорных реплик, прерывания и фоновые реплики слушателя (backchannels).

Проверяет реакцию на фоновую речь, обращение к другому человеку, реплики слушателя и прерывания.

Измеряет, насколько быстро агент начинает ответ после того, как пользователь завершил свою реплику.

Тестирует использование инструментов по устным запросам, содержащим естественные паузы, колебания и самоисправления. Pass@1 оценивает последовательность вызовов инструментов.


* Бэкенд GPT Live: Terra (низкий).

Оценивает устный ответ на запросы с использованием инструментов, содержащие паузы, колебания и самоисправления. Оценивает, насколько точно ответ соответствует эталонному намерению.


* Бэкенд GPT Live: Terra (низкий).

Что говорят клиенты

1 из 4
»Интеграция GPT‑Live‑1 в Yelp Host и Hatch улучшила очередность реплик и точность по сравнению с нашей традиционной голосовой архитектурой. Когда Yelp Host использует GPT‑Live‑1 для ответов на звонки, например при бронировании столиков и заказе еды, мы наблюдаем значительное улучшение показателей обработки вызовов. Кроме того, абоненты стали говорить более полными и естественными предложениями, что говорит о том, что взаимодействие на другом конце провода воспринимается совершенно иначе.»
—Алекс Леви (Alex Levy), технический директор

Новые варианты голосов

Разработчикам нужны голоса, которые подходят их продукту и звучат естественно для пользователей. С выходом GPT‑Live‑1 мы расширяем небольшой набор голосов реального времени до более широкого выбора с учетом акцентов, диалектов и языков, предоставляя разработчикам больше возможностей для выбора того, как звучат их ассистенты.

Оцените новые голоса

Мы продолжим расширять выбор голосов и поддержку языков в ближайшие месяцы.

Цены и доступность

Модель GPT‑Live‑1 доступна в API уже сегодня по цене $0.05 за минуту для интерфейсного голосового слоя. Объедините её с бэкенд-моделью и агентской обвязкой, подходящими для вашего продукта, чтобы создать голосовое взаимодействие, масштабируемое под ваши задачи.

Подключение GPT-Live-1 к Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Подключение GPT-Live-1 к Codex. В этом фрагменте показано, как приложение передает контекст беседы в Codex и возвращает его ответ обратно в GPT-Live-1. Настройка соединения и обработка делегирования опущены.

Для получения доступа к индивидуальным голосам свяжитесь с отделом продаж, чтобы узнать подробнее об условиях и процедуре подачи заявки.

Еще один способ создания голосовых рабочих процессов на базе GPT‑Live‑1 — использование OpenAI Presence, платформы, которая задействует модель для голосового взаимодействия в реальном времени. Presence помогает предприятиям внедрять надежные ИИ-агенты, способные отвечать на вопросы, решать проблемы, использовать корпоративные системы, выполнять утвержденные действия и при необходимости переключать пользователей на живых сотрудников. Обратитесь к своему менеджеру по работе с клиентами OpenAI, чтобы узнать больше.

Автор

OpenAI

Полный текст статьи читайте на OpenAI