Темы



Представляем gpt-realtime и обновления Realtime API для голосовых агентов в продакшене

Мы выпускаем более продвинутую модель «речь-речь» и новые возможности API, включая поддержку серверов MCP, ввод изображений и поддержку телефонных звонков по протоколу SIP.

Stylized interface showing a voice interaction. Centered is a rounded rectangular audio player with a waveform visualization, play/pause button,

Сегодня мы объявляем о выпуске Realtime API в общем доступе с новыми функциями, которые позволяют разработчикам и предприятиям создавать надежные голосовые агенты, готовые к внедрению в производство. Теперь API поддерживает удаленные MCP-серверы, ввод изображений и телефонные звонки через протокол инициирования сеанса (SIP), что расширяет возможности голосовых агентов за счет доступа к дополнительным инструментам и контексту.

Мы также выпускаем нашу самую передовую модель преобразования речи в речь на сегодняшний день — gpt-realtime. Новая модель демонстрирует улучшения в выполнении сложных инструкций, точном вызове инструментов и создании более естественной и выразительной речи. Она лучше интерпретирует системные сообщения и промпты разработчиков — будь то дословное чтение текста отказа от ответственности во время звонка в службу поддержки, повторение буквенно-цифровых последовательностей или плавное переключение между языками прямо посреди предложения. Мы также представляем два новых голоса, Cedar и Marin, которые с сегодняшнего дня доступны исключительно в Realtime API.

С момента первого представления Realtime API в публичной бета-версии в октябре прошлого года тысячи разработчиков создавали решения на его базе и помогли сформировать улучшения, которые мы выпускаем сегодня. Они оптимизированы для обеспечения надежности, низкой задержки и высокого качества с целью успешного развертывания голосовых агентов в продакшене. В отличие от традиционных конвейеров, объединяющих несколько моделей для распознавания речи в текст и синтеза текста в речь, Realtime API обрабатывает и генерирует аудио напрямую с помощью одной модели и API. Это снижает задержку, сохраняет нюансы речи и обеспечивает более естественные и выразительные ответы.

Знакомство с gpt-realtime

Новая модель преобразования речи в речь — gpt-realtime — это наша самая передовая голосовая модель, готовая к производственному использованию. Мы обучили модель в тесном сотрудничестве с клиентами, чтобы она преуспевала в решении реальных задач, таких как поддержка клиентов, персональные ассистенты и образование, адаптируя модель под то, как разработчики создают и развертывают голосовых агентов. Модель демонстрирует улучшения в качестве звука, интеллектуальных возможностях, следовании инструкциям и вызове функций.

Качество звука

Естественно звучащая беседа имеет решающее значение для внедрения голосовых агентов в реальном мире. Моделям необходимо говорить с интонацией, эмоциями и темпом человека, чтобы создать приятный опыт и побудить пользователей к непрерывному общению. Мы обучили gpt-realtime воспроизводить более качественную речь, которая звучит более естественно и способна следовать детализированным инструкциям, например «говори быстро и профессионально» или «говори сочувственно с французским акцентом».

Мы добавляем в API два новых голоса, Marin и Cedar, которые демонстрируют самые значительные улучшения в естественности звучания речи. Мы также обновляем наши существующие восемь голосов, чтобы они получили эти улучшения.

Пример голоса — Marin
Пример голоса — Cedar

Интеллект и понимание

gpt-realtime демонстрирует более высокий интеллект и способен понимать нативный звук с большей точностью. Модель может улавливать невербальные сигналы (например, смех), переключаться между языками посреди предложения и адаптировать тон («бодрый и профессиональный» или «добрый и сочувственный»). Согласно внутренним оценкам, модель также показывает более высокую точность при распознавании буквенно-цифровых последовательностей (таких как номера телефонов, VIN-коды и т. д.) на других языках, включая испанский, китайский, японский и французский. В тесте Big Bench Audio, оценивающем возможности логического рассуждения, gpt-realtime набирает 82.8% точности, превосходя нашу предыдущую модель от декабря 2024 года, которая набирает 65.6%.

Бенчмарк Big Bench Audio⁠ представляет собой оценочный датасет для проверки возможностей рассуждения языковых моделей, поддерживающих ввод аудио. Этот датасет адаптирует вопросы из Big Bench Hard — выбранного за строгое тестирование продвинутого логического мышления — в аудиодомен.

Следование инструкциям

При создании приложения «речь-речь» разработчики дают модели набор инструкций о том, как себя вести, включая то, как говорить, что сказать в определенной ситуации, и что делать или не делать. Мы сосредоточили наши улучшения на соблюдении этих инструкций, чтобы даже незначительные указания несли больше смысла для модели. В аудио-бенчмарке MultiChallenge, измеряющем точность следования инструкциям, gpt-realtime набирает 30.5%, что является значительным улучшением по сравнению с нашей предыдущей моделью от декабря 2024 года, которая набирает 20.6%.

MultiChallenge⁠ оценивает, насколько хорошо языковые модели справляются с многоходовыми диалогами с людьми. Он фокусируется на четырех категориях реалистичных задач, с которыми текущие передовые модели испытывают трудности. Эти задачи требуют от моделей одновременного сочетания следования инструкциям, управления контекстом и контекстуальных рассуждений. Мы преобразовали дружественную к аудио подвыборку тестовых вопросов из текста в речь, чтобы создать аудиоверсию этой оценки.

Вызов функций

Чтобы создать способного голосового агента с помощью модели «речь-речь», модель должна уметь вызывать правильные инструменты в нужное время для эффективной работы в продакшене. Мы улучшили вызов функций по трем направлениям: вызов релевантных функций, вызов функций в подходящее время и вызов функций с подходящими аргументами (что приводит к повышению точности). В аудио-тесте ComplexFuncBench, измеряющем производительность вызова функций, gpt-realtime набирает 66.5%, в то время как наша предыдущая модель от декабря 2024 года набирает 49.7%.

Мы также внесли улучшения в асинхронный вызов функций⁠. Долго выполняющиеся вызовы функций больше не будут нарушать ход сеанса — модель может продолжать плавную беседа во время ожидания результатов. Эта функция доступна изначально в gpt-realtime, поэтому разработчикам не нужно обновлять свой код.

ComplexFuncBench⁠ измеряет, насколько хорошо модели справляются со сложными задачами вызова функций. Он оценивает производительность в таких сценариях, как многоэтапные вызовы, рассуждения об ограничениях или неявных параметрах, и обработка очень длинных входных данных. Мы преобразовали исходные текстовые промпты в речь, чтобы создать эту оценку для нашей модели.

Новое в Realtime API

Поддержка удаленных MCP-серверов

Вы можете включить поддержку MCP в сеансе Realtime API, передав URL-адрес удаленного MCP-сервера в конфигурацию сеанса. После подключения API автоматически обрабатывает вызовы инструментов за вас, поэтому нет необходимости настраивать интеграции вручную.

Эта настройка позволяет легко расширить возможности вашего агента — просто укажите сеансу другой MCP-сервер, и эти инструменты станут доступны сразу же. Чтобы узнать больше о настройке MCP с Realtime, ознакомьтесь с этим руководством⁠.

JavaScript

1
// POST /v1/realtime/client_secrets
2
{
3
"session": {
4
"type": "realtime",
5
"tools": [
6
{
7
"type": "mcp",
8
"server_label": "stripe",
9
"server_url": "https://mcp.stripe.com",
10
"authorization": "{access_token}",
11
"require_approval": "never"
12
}
13
]
14
}
15
}
16

Ввод изображений

Теперь, когда в gpt-realtime поддерживается ввод изображений, вы можете добавлять изображения, фотографии и скриншоты наряду с аудио или текстом в сеанс Realtime API. Теперь модель может связывать беседу с тем, что видит пользователь на самом деле, позволяя задавать вопросы вроде «что ты видишь?» или «прочитай текст на этом скриншоте».

Вместо того чтобы относиться к изображению как к потоку видео в реальном времени, система рассматривает его скорее как добавление картинки в беседу. Ваше приложение может решать, какие изображения и когда передавать модели. Таким образом, вы сохраняете контроль над тем, что видит модель и когда она отвечает.

Ознакомьтесь с нашей документацией⁠, чтобы начать работу с вводом изображений.

JavaScript

1
{
2
"type": "conversation.item.create",
3
"previous_item_id": null,
4
"item": {
5
"type": "message",
6
"role": "user",
7
"content": [
8
{
9
"type": "input_image",
10
"image_url": "data:image/{format(example: png)};base64,{some_base64_image_bytes}"
11
}
12
]
13
}
14
}
15

Дополнительные возможности

Мы добавили ряд других функций, чтобы сделать Realtime API проще в интеграции и более гибким для использования в продакшене.

  • Поддержка протокола инициирования сеанса (SIP): Подключайте свои приложения к публичной телефонной сети, АТС, настольным телефонам и другим конечным точкам SIP с помощью прямой поддержки в Realtime API. Прочитайте об этом в документации.⁠
  • Многократно используемые промпты: Теперь вы можете сохранять и повторно использовать промпты, состоящие из сообщений разработчика, инструментов, переменных и примеров сообщений пользователя/ассистента, в разных сеансах Realtime API, как в Responses API. Узнайте больше в документации.⁠

Безопасность и конфиденциальность

Realtime API включает в себя многоуровневые средства защиты и минимизации рисков для предотвращения злоупотреблений. Вы можете подробнее узнать о нашем подходе к безопасности и деталях системной карты в бета-анонсе в блоге⁠. Мы используем активные классификаторы для сеансов Realtime API, что означает, что определенные беседы могут быть прерваны, если будет обнаружено нарушение наших правил в отношении вредоносного контента. Разработчики также могут легко добавлять собственные дополнительные защитные механизмы, используя Agents SDK⁠.

Наши правила использования⁠ запрещают перепрофилирование или распространение результатов работы наших сервисов для спама, мошенничества или иных вредоносных целей. Разработчики также должны четко давать понять конечным пользователям, когда они взаимодействуют с ИИ, если это не очевидно из контекста. Realtime API использует заранее установленные голоса, чтобы злоумышленники не могли выдавать себя за других лиц.

Realtime API полностью поддерживает релокацию данных в ЕС⁠ для приложений, базирующихся в Европейском союзе, и подпадает под действие наших обязательств по обеспечению конфиденциальности корпоративного уровня⁠.

Цены и доступность

Общедоступный интерфейс Realtime API и новая модель gpt-realtime доступны всем разработчикам начиная с сегодняшнего дня. Мы снижаем цены на gpt-realtime на 20% по сравнению с gpt-4o-realtime-preview — $32 за 1 млн токенов аудиовхода ($0,40 за кэшированные токены входа) и $64 за 1 млн токенов аудиовыхода (см. подробные цены⁠). Мы также добавили детальное управление контекстом диалога, позволяющее разработчикам задавать интеллектуальные лимиты токенов и усекать сразу несколько реплик, что существенно снижает затраты на длительные сеансы.

Чтобы начать работу, посетите нашу документацию по Realtime API⁠, протестируйте новую модель в Playground⁠ и ознакомьтесь с нашим руководством по промптингу для Realtime API⁠.

Запись прямой трансляции

Автор

OpenAI

Полный текст статьи читайте на OpenAI