Представляем gpt-realtime и обновления Realtime API для голосовых агентов в продакшене
Мы выпускаем более продвинутую модель «речь-речь» и новые возможности API, включая поддержку серверов MCP, ввод изображений и поддержку телефонных звонков по протоколу SIP.

Сегодня мы объявляем о выпуске Realtime API в общем доступе с новыми функциями, которые позволяют разработчикам и предприятиям создавать надежные голосовые агенты, готовые к внедрению в производство. Теперь API поддерживает удаленные MCP-серверы, ввод изображений и телефонные звонки через протокол инициирования сеанса (SIP), что расширяет возможности голосовых агентов за счет доступа к дополнительным инструментам и контексту.
Мы также выпускаем нашу самую передовую модель преобразования речи в речь на сегодняшний день — gpt-realtime. Новая модель демонстрирует улучшения в выполнении сложных инструкций, точном вызове инструментов и создании более естественной и выразительной речи. Она лучше интерпретирует системные сообщения и промпты разработчиков — будь то дословное чтение текста отказа от ответственности во время звонка в службу поддержки, повторение буквенно-цифровых последовательностей или плавное переключение между языками прямо посреди предложения. Мы также представляем два новых голоса, Cedar и Marin, которые с сегодняшнего дня доступны исключительно в Realtime API.
С момента первого представления Realtime API в публичной бета-версии в октябре прошлого года тысячи разработчиков создавали решения на его базе и помогли сформировать улучшения, которые мы выпускаем сегодня. Они оптимизированы для обеспечения надежности, низкой задержки и высокого качества с целью успешного развертывания голосовых агентов в продакшене. В отличие от традиционных конвейеров, объединяющих несколько моделей для распознавания речи в текст и синтеза текста в речь, Realtime API обрабатывает и генерирует аудио напрямую с помощью одной модели и API. Это снижает задержку, сохраняет нюансы речи и обеспечивает более естественные и выразительные ответы.
Знакомство с gpt-realtime
Новая модель преобразования речи в речь — gpt-realtime — это наша самая передовая голосовая модель, готовая к производственному использованию. Мы обучили модель в тесном сотрудничестве с клиентами, чтобы она преуспевала в решении реальных задач, таких как поддержка клиентов, персональные ассистенты и образование, адаптируя модель под то, как разработчики создают и развертывают голосовых агентов. Модель демонстрирует улучшения в качестве звука, интеллектуальных возможностях, следовании инструкциям и вызове функций.
Качество звука
Естественно звучащая беседа имеет решающее значение для внедрения голосовых агентов в реальном мире. Моделям необходимо говорить с интонацией, эмоциями и темпом человека, чтобы создать приятный опыт и побудить пользователей к непрерывному общению. Мы обучили gpt-realtime воспроизводить более качественную речь, которая звучит более естественно и способна следовать детализированным инструкциям, например «говори быстро и профессионально» или «говори сочувственно с французским акцентом».
Мы добавляем в API два новых голоса, Marin и Cedar, которые демонстрируют самые значительные улучшения в естественности звучания речи. Мы также обновляем наши существующие восемь голосов, чтобы они получили эти улучшения.
Интеллект и понимание
gpt-realtime демонстрирует более высокий интеллект и способен понимать нативный звук с большей точностью. Модель может улавливать невербальные сигналы (например, смех), переключаться между языками посреди предложения и адаптировать тон («бодрый и профессиональный» или «добрый и сочувственный»). Согласно внутренним оценкам, модель также показывает более высокую точность при распознавании буквенно-цифровых последовательностей (таких как номера телефонов, VIN-коды и т. д.) на других языках, включая испанский, китайский, японский и французский. В тесте Big Bench Audio, оценивающем возможности логического рассуждения, gpt-realtime набирает 82.8% точности, превосходя нашу предыдущую модель от декабря 2024 года, которая набирает 65.6%.
Бенчмарк Big Bench Audio представляет собой оценочный датасет для проверки возможностей рассуждения языковых моделей, поддерживающих ввод аудио. Этот датасет адаптирует вопросы из Big Bench Hard — выбранного за строгое тестирование продвинутого логического мышления — в аудиодомен.
Следование инструкциям
При создании приложения «речь-речь» разработчики дают модели набор инструкций о том, как себя вести, включая то, как говорить, что сказать в определенной ситуации, и что делать или не делать. Мы сосредоточили наши улучшения на соблюдении этих инструкций, чтобы даже незначительные указания несли больше смысла для модели. В аудио-бенчмарке MultiChallenge, измеряющем точность следования инструкциям, gpt-realtime набирает 30.5%, что является значительным улучшением по сравнению с нашей предыдущей моделью от декабря 2024 года, которая набирает 20.6%.
MultiChallenge оценивает, насколько хорошо языковые модели справляются с многоходовыми диалогами с людьми. Он фокусируется на четырех категориях реалистичных задач, с которыми текущие передовые модели испытывают трудности. Эти задачи требуют от моделей одновременного сочетания следования инструкциям, управления контекстом и контекстуальных рассуждений. Мы преобразовали дружественную к аудио подвыборку тестовых вопросов из текста в речь, чтобы создать аудиоверсию этой оценки.
Вызов функций
Чтобы создать способного голосового агента с помощью модели «речь-речь», модель должна уметь вызывать правильные инструменты в нужное время для эффективной работы в продакшене. Мы улучшили вызов функций по трем направлениям: вызов релевантных функций, вызов функций в подходящее время и вызов функций с подходящими аргументами (что приводит к повышению точности). В аудио-тесте ComplexFuncBench, измеряющем производительность вызова функций, gpt-realtime набирает 66.5%, в то время как наша предыдущая модель от декабря 2024 года набирает 49.7%.
Мы также внесли улучшения в асинхронный вызов функций. Долго выполняющиеся вызовы функций больше не будут нарушать ход сеанса — модель может продолжать плавную беседа во время ожидания результатов. Эта функция доступна изначально в gpt-realtime, поэтому разработчикам не нужно обновлять свой код.
ComplexFuncBench измеряет, насколько хорошо модели справляются со сложными задачами вызова функций. Он оценивает производительность в таких сценариях, как многоэтапные вызовы, рассуждения об ограничениях или неявных параметрах, и обработка очень длинных входных данных. Мы преобразовали исходные текстовые промпты в речь, чтобы создать эту оценку для нашей модели.
Новое в Realtime API
Поддержка удаленных MCP-серверов
Вы можете включить поддержку MCP в сеансе Realtime API, передав URL-адрес удаленного MCP-сервера в конфигурацию сеанса. После подключения API автоматически обрабатывает вызовы инструментов за вас, поэтому нет необходимости настраивать интеграции вручную.
Эта настройка позволяет легко расширить возможности вашего агента — просто укажите сеансу другой MCP-сервер, и эти инструменты станут доступны сразу же. Чтобы узнать больше о настройке MCP с Realtime, ознакомьтесь с этим руководством.
JavaScript
1// POST /v1/realtime/client_secrets2{3 "session": {4 "type": "realtime",5 "tools": [6 {7 "type": "mcp",8 "server_label": "stripe",9 "server_url": "https://mcp.stripe.com",10 "authorization": "{access_token}",11 "require_approval": "never"12 }13 ]14 }15}16
Ввод изображений
Теперь, когда в gpt-realtime поддерживается ввод изображений, вы можете добавлять изображения, фотографии и скриншоты наряду с аудио или текстом в сеанс Realtime API. Теперь модель может связывать беседу с тем, что видит пользователь на самом деле, позволяя задавать вопросы вроде «что ты видишь?» или «прочитай текст на этом скриншоте».
Вместо того чтобы относиться к изображению как к потоку видео в реальном времени, система рассматривает его скорее как добавление картинки в беседу. Ваше приложение может решать, какие изображения и когда передавать модели. Таким образом, вы сохраняете контроль над тем, что видит модель и когда она отвечает.
Ознакомьтесь с нашей документацией, чтобы начать работу с вводом изображений.
JavaScript
1{2 "type": "conversation.item.create",3 "previous_item_id": null,4 "item": {5 "type": "message",6 "role": "user",7 "content": [8 {9 "type": "input_image",10 "image_url": "data:image/{format(example: png)};base64,{some_base64_image_bytes}"11 }12 ]13 }14}15
Дополнительные возможности
Мы добавили ряд других функций, чтобы сделать Realtime API проще в интеграции и более гибким для использования в продакшене.
- Поддержка протокола инициирования сеанса (SIP): Подключайте свои приложения к публичной телефонной сети, АТС, настольным телефонам и другим конечным точкам SIP с помощью прямой поддержки в Realtime API. Прочитайте об этом в документации.
- Многократно используемые промпты: Теперь вы можете сохранять и повторно использовать промпты, состоящие из сообщений разработчика, инструментов, переменных и примеров сообщений пользователя/ассистента, в разных сеансах Realtime API, как в Responses API. Узнайте больше в документации.
Безопасность и конфиденциальность
Realtime API включает в себя многоуровневые средства защиты и минимизации рисков для предотвращения злоупотреблений. Вы можете подробнее узнать о нашем подходе к безопасности и деталях системной карты в бета-анонсе в блоге. Мы используем активные классификаторы для сеансов Realtime API, что означает, что определенные беседы могут быть прерваны, если будет обнаружено нарушение наших правил в отношении вредоносного контента. Разработчики также могут легко добавлять собственные дополнительные защитные механизмы, используя Agents SDK.
Наши правила использования запрещают перепрофилирование или распространение результатов работы наших сервисов для спама, мошенничества или иных вредоносных целей. Разработчики также должны четко давать понять конечным пользователям, когда они взаимодействуют с ИИ, если это не очевидно из контекста. Realtime API использует заранее установленные голоса, чтобы злоумышленники не могли выдавать себя за других лиц.
Realtime API полностью поддерживает релокацию данных в ЕС для приложений, базирующихся в Европейском союзе, и подпадает под действие наших обязательств по обеспечению конфиденциальности корпоративного уровня.
Цены и доступность
Общедоступный интерфейс Realtime API и новая модель gpt-realtime доступны всем разработчикам начиная с сегодняшнего дня. Мы снижаем цены на gpt-realtime на 20% по сравнению с gpt-4o-realtime-preview — $32 за 1 млн токенов аудиовхода ($0,40 за кэшированные токены входа) и $64 за 1 млн токенов аудиовыхода (см. подробные цены). Мы также добавили детальное управление контекстом диалога, позволяющее разработчикам задавать интеллектуальные лимиты токенов и усекать сразу несколько реплик, что существенно снижает затраты на длительные сеансы.
Чтобы начать работу, посетите нашу документацию по Realtime API, протестируйте новую модель в Playground и ознакомьтесь с нашим руководством по промптингу для Realtime API.
Запись прямой трансляции
Автор
Полный текст статьи читайте на OpenAI
