Представляем Realtime API
Теперь разработчики могут создавать быстрые речевые интерактивные функции (speech-to-speech) в своих приложениях

Обновление от 28 августа 2025 г.: Мы объявили о широкой доступности (General Availability) Realtime API. Узнайте больше здесь.
Обновление от 3 февраля 2025 г.: Мы больше не ограничиваем количество одновременных сеансов в Realtime API. Пожалуйста, ознакомьтесь с нашей документацией, чтобы узнать о последних лимитах на запросы для Realtime API.
Обновление от 30 октября 2024 г.: Мы добавили пять новых голосов с более широким диапазоном и выразительностью. Кэшированное ценообразование теперь также доступно для текстовых и аудиовходов, снижая цену до $2.50 за 1 млн токенов кэшированного текстового ввода и $20 за 1 млн токенов кэшированного аудиоввода. Узнайте больше здесь.
Обновление от 17 октября 2024 г.: Аудиовходы и аудиовыходы теперь доступны в Chat Completions API. Начните работу здесь.
Сегодня мы представляем публичную бета-версию Realtime API, которая позволяет всем платным разработчикам создавать мультимодальные приложения с низким временем отклика. Подобно расширенному голосовому режиму (Advanced Voice Mode) в ChatGPT, Realtime API поддерживает естественные речевые диалоги с использованием шести предустановленных голосов, которые уже поддерживаются в API.
Мы также добавляем аудиовход и аудиовыход в Chat Completions API для поддержки сценариев использования, не требующих преимуществ Realtime API в плане низкой задержки. С этим обновлением разработчики могут передавать любые текстовые или аудиовходы в GPT‑4o и получать от модели ответ в виде текста, аудио или обоих форматов одновременно.
От языковых приложений и образовательного софта до систем поддержки клиентов — разработчики уже используют голосовые возможности для взаимодействия со своими пользователями. Теперь, с появлением Realtime API и скорым появлением аудио в Chat Completions API, разработчикам больше не нужно объединять несколько моделей для реализации этих функций. Вместо этого вы можете создавать естественные разговорные интерфейсы с помощью всего одного вызова API.
Как это работает
Ранее для создания аналогичного голосового ассистента разработчикам приходилось транскрибировать аудио с помощью модели автоматического распознавания речи, такой как Whisper, передавать текст текстовой модели для инференса или рассуждений, а затем воспроизводить результат работы модели с помощью модели синтеза речи. Такой подход часто приводил к потере эмоций, интонаций и акцентов, а также к заметной задержке. С Chat Completions API разработчики могут обрабатывать весь процесс с помощью одного вызова API, хотя этот способ все еще работает медленнее человеческого разговора. Realtime API улучшает этот процесс за счет прямой потоковой передачи аудиовходов и аудиовыходов, обеспечивая более естественное общение. Он также может автоматически обрабатывать прерывания, во многом подобно продвинутому голосовому режиму (Advanced Voice Mode) в ChatGPT.
«Под капотом» Realtime API позволяет создать постоянное WebSocket-соединение для обмена сообщениями с GPT‑4o. API поддерживает вызов функций (function calling), что позволяет голосовым ассистентам реагировать на запросы пользователей, запуская определенные действия или подтягивая новый контекст. Например, голосовой ассистент может оформить заказ от имени пользователя или извлечь соответствующую информацию о клиенте для персонализации ответов.
Создание агентов поддержки клиентов, ассистентов для изучения языков и многого другого
В рамках нашей стратегии итеративного развертывания мы тестировали Realtime API с несколькими партнерами, чтобы собрать отзывы в процессе разработки. Вот два перспективных ранних сценария использования:
Healthify, приложение для коучинга по питанию и фитнесу, использует Realtime API для обеспечения естественных разговоров со своим ИИ-тренером Риа (Ria), подключая при необходимости профессиональных диетологов для получения персонализированной поддержки.
Speak, приложение для изучения языков, использует Realtime API для работы функции ролевых игр, поощряя пользователей практиковать разговорную речь на новом языке.
Доступность и цены
Realtime API начинает внедряться сегодня в режиме публичной бета-версии для всех платных разработчиков. Аудиовозможности в Realtime API работают на базе новой модели GPT‑4o gpt-4o-realtime-preview.
Аудио в Chat Completions API будет выпущено в ближайшие недели в виде новой модели gpt-4o-audio-preview. С помощью gpt-4o-audio-preview разработчики могут передавать текст или аудио в GPT‑4o и получать ответы в текстовом, аудио- или обоих форматах.
Realtime API использует как текстовые, так и аудиотокены. Стоимость текстовых входных токенов составляет $5 за 1 млн, а выходных — $20 за 1 млн. Аудиовход стоит $100 за 1 млн токенов, а аудиовыход — $200 за 1 млн токенов. Это эквивалентно примерно $0.06 за минуту аудиовхода и $0.24 за минуту аудиовыхода. Аудио в Chat Completions API будет стоить столько же.
Безопасность и конфиденциальность
Realtime API использует многоуровневую систему защиты для снижения риска злоупотребления API, включая автоматический мониторинг и экспертную оценку помеченных входных и выходных данных модели. Realtime API построен на той же версии GPT‑4o, которая используется в продвинутом голосовом режиме (Advanced Voice Mode) в ChatGPT. Мы тщательно оценили её с помощью автоматизированных и экспертных проверок, в том числе в соответствии с нашей методологией обеспечения готовности (Preparedness Framework), подробно описанной в системной карте GPT‑4o. Realtime API также использует ту же инфраструктуру аудио-безопасности, которую мы создали для продвинутого голосового режима; наши тесты показывают, что это помогло снизить потенциальный ущерб.
Использование результатов работы наших сервисов для рассылки спама, введения в заблуждение или причинения иного вреда нарушает наши правила использования — и мы активно отслеживаем потенциальные злоупотребления. Наши правила также требуют, чтобы разработчики четко давали понять пользователям, что те взаимодействуют с искусственным интеллектом, если это не очевидно из контекста.
Перед запуском мы протестировали Realtime API с привлечением нашей внешней сети red teaming (специалистов по этичному хакингу) и выяснили, что Realtime API не привносит никаких рискованных уязвимостей, не покрытых нашими существующими средствами защиты. Как и все сервисы API, Realtime API подпадает под действие наших обязательств по корпоративной конфиденциальности. Мы не обучаем наши модели на входных или выходных данных, используемых в этом сервисе, без вашего явного разрешения.
Начало работы
Разработчики могут начать создание приложений с помощью Realtime API в ближайшие дни в Playground, либо используя нашу документацию и эталонный клиент.
Мы также поработали с LiveKit и Agora над созданием клиентских библиотек аудиокомпонентов (таких как эхоподавление, переподключение и изоляция звука), а также с Twilio для интеграции Realtime API с голосовыми API Twilio, которые позволяют разработчикам беспрепятственно создавать, развертывать и подключать виртуальных ИИ-агентов к клиентам посредством голосовых вызовов.
Что дальше
Работая над обеспечением общей доступности, мы активно собираем отзывы для улучшения Realtime API. Среди возможностей, которые мы планируем внедрить:
- Больше модальностей: Для начала Realtime API будет поддерживать голос, а со временем мы планируем добавить и другие модальности, такие как зрение и видео.
- Увеличенные лимиты запросов: На сегодняшний день в API действует лимит примерно в 100 одновременных сеансов для разработчиков 5-го уровня (Tier 5) и более низкие лимиты для уровней 1–4. Со временем мы увеличим эти лимиты для поддержки более масштабных развертываний.
- Официальная поддержка SDK: Мы интегрируем поддержку Realtime API в SDK OpenAI для Python и Node.js.
- Кэширование промптов: Мы добавим поддержку кэширования промптов (Prompt Caching), чтобы предыдущие шаги диалога можно было повторно обрабатывать со скидкой.
- Расширенная поддержка моделей: Realtime API также будет поддерживать GPT‑4o mini в будущих версиях этой модели.
Мы с нетерпением ждем возможности увидеть, как разработчики используют эти новые функции для создания потрясающих аудиоинтерфейсов для своих пользователей в самых разных сценариях: от образования и перевода до обслуживания клиентов, обеспечения доступности и многого другого.
Автор
Полный текст статьи читайте на OpenAI
