Представляем аудимодели нового поколения в API
Новый набор аудиомоделей для работы голосовых агентов теперь доступен разработчикам по всему миру.

Обновление от 28 августа 2025 г.: Мы объявили о широкой доступности Realtime API. Подробнее читайте здесь.
За последние несколько месяцев мы вложили значительные средства в развитие интеллекта, возможностей и полезности текстовых агентов — систем, которые самостоятельно выполняют задачи от имени пользователей, таких как Operator, Deep Research, Computer-Using Agents и Responses API со встроенными инструментами. Однако для того, чтобы агенты были по-настоящему полезными, людям необходима возможность более глубокого и интуитивного взаимодействия с ними, выходящего за рамки обычного текста, — общение с использованием естественной разговорной речи.
Сегодня мы запускаем новые аудиомодели для преобразования речи в текст и текста в речь в API, что позволяет создавать более мощные, настраиваемые и интеллектуальные голосовые агенты, несущие реальную пользу. Наши новейшие модели преобразования речи в текст задают новый стандарт качества, превосходя существующие решения по точности и надежности, особенно в сложных сценариях, включающих акценты, шумную обстановку и разную скорость речи. Эти улучшения повышают надежность транскрипции, делая модели особенно подходящими для таких сценариев использования, как центры обработки вызовов, расшифровка заметок совещаний и многое другое.
Впервые разработчики также могут давать модели преобразования текста в речь инструкции говорить определенным образом — например, «говори как сочувствующий агент службы поддержки», — что открывает новый уровень кастомизации для голосовых агентов. Это позволяет создавать широкий спектр специализированных приложений: от более эмпатичных и динамичных голосов службы поддержки до выразительного повествования для творческих историй.
Мы выпустили нашу первую аудиомодель в 2022 году, и с тех пор мы стремимся повышать интеллект, точность и надежность этих моделей. С помощью этих новых аудиомоделей разработчики могут создавать более точные и надежные системы распознавания речи, а также выразительные голоса с ярким характером для синтеза речи — и все это в рамках API.
Подробнее о наших новейших аудиомоделях
Новые модели преобразования речи в текст
Мы представляем новые модели gpt-4o-transcribe и gpt-4o-mini-transcribe с улучшенным показателем частоты ошибок в словах (WER), а также более качественным распознаванием языков и повышенной точностью по сравнению с оригинальными моделями Whisper.
gpt-4o-transcribe демонстрирует лучшие показатели частоты ошибок в словах (WER) по сравнению с существующими моделями Whisper на множестве признанных бенчмарков, что отражает значительный прогресс в нашей технологии распознавания речи. Эти достижения стали прямым результатом целенаправленных инноваций в области обучения с подкреплением и масштабного промежуточного обучения (midtraining) на разнообразных высококачественных аудиодатасетах.
В результате эти новые модели преобразования речи в текст лучше улавливают нюансы речи, снижают количество ошибок распознавания и повышают надежность транскрипции, особенно в сложных сценариях с акцентами, шумной обстановкой и разной скоростью речи. Эти модели уже доступны в API распознавания речи.
Частота ошибок в словах (WER) измеряет точность моделей распознавания речи путем вычисления процента неправильно транскрибированных слов по сравнению с эталонной расшифровкой — более низкое значение WER лучше и означает меньше ошибок. Наши новейшие модели преобразования речи в текст достигают более низкого показателя WER на различных бенчмарках, включая FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech) — многоязычный речевой бенчмарк, охватывающий более 100 языков с использованием вручную расшифрованных аудиофрагментов. Эти результаты демонстрируют более высокую точность транскрипции и более надежное языковое покрытие. Как показано здесь, наши модели стабильно превосходят Whisper v2 и Whisper v3 во всех языковых оценках.
На бенчмарке FLEURS наши модели обеспечивают более низкий показатель WER и высокую многоязычную производительность. Более низкое значение WER лучше и означает меньше ошибок. Как показано здесь, наши модели не уступают или превосходят другие ведущие модели на большинстве основных языков.
Новая модель преобразования текста в речь
Мы также запускаем новую модель gpt-4o-mini-tts с улучшенными возможностями управления. Впервые разработчики могут «инструктировать» модель не только о том, что сказать, но и о том, как это сказать, что открывает более широкие возможности настройки для сценариев применения — от обслуживания клиентов до художественного повествования. Модель доступна в API синтеза речи (text-to-speech). Обратите внимание, что эти модели ограничены искусственными предустановленными голосами, которые мы отслеживаем, чтобы они неизменно соответствовали синтетическим пресетам.
Технические инновации, лежащие в основе моделей
Предварительное обучение на аутентичных аудиодатасетах
Наши новые аудиомодели созданы на базе архитектур GPT‑4o и GPT‑4o‑mini и прошли масштабное предварительное обучение на специализированных аудиоцентричных датасетах, что сыграло критически важную роль в оптимизации их производительности. Такой целенаправленный подход обеспечивает более глубокое понимание речевых нюансов и гарантирует исключительную производительность в задачах, связанных с обработкой аудио.
Продвинутые методологии дистилляции
Мы усовершенствовали методы дистилляции, обеспечив передачу знаний от наших крупнейших аудиомоделей к более компактным и эффективным системам. Используя передовые методологии самообучения (self-play), наши датасеты для дистилляции эффективно отражают реалистичную динамику беседы, воспроизводя подлинное взаимодействие между пользователем и ассистентом. Это помогает нашим компактным моделям обеспечивать превосходное качество диалога и высокую скорость отклика.
Парадигма обучения с подкреплением
Для моделей преобразования речи в текст мы внедрили парадигму, в которой значительную роль играет обучение с подкреплением (RL), подняв точность транскрипции до передового уровня. Эта методология кардинально повышает точность и сокращает количество галлюцинаций, делая наши решения для распознавания речи исключительно конкурентоспособными в сложных сценариях.
Эти разработки представляют собой значительный прогресс в области аудимоделирования, объединяя инновационные методологии с практическими улучшениями для повышения производительности в речевых приложениях.
Доступность через API
Эти новые аудиомодели уже доступны всем разработчикам — подробнее о разработке с использованием аудио читайте здесь. Для разработчиков, которые уже создают диалоговые интерфейсы на базе текстовых моделей, добавление наших моделей распознавания и синтеза речи — это самый простой способ создать голосового агента. Мы выпускаем интеграцию с Agents SDK, которая упрощает этот процесс разработки. Разработчикам, желающим создавать голосовые интерактивные интерфейсы с низкой задержкой (speech-to-speech), мы рекомендуем использовать наши аудиомодели в Realtime API.
Что дальше
Заглядывая в будущее, мы планируем и дальше инвестировать в повышение интеллекта и точности наших аудиомоделей, а также изучать способы, которые позволят разработчикам использовать собственные настраиваемые голоса для создания еще более персонализированных возможностей способами, отвечающими нашим стандартам безопасности. Кроме того, мы продолжаем диалог с политиками, исследователями, разработчиками и творческими людьми по поводу проблем и возможностей, которые могут представлять синтетические голоса. Мы с нетерпением ждем инновационных и креативных приложений, которые разработчики создадут с помощью этих расширенных аудиовозможностей. Мы также будем инвестировать в другие модальности, включая видео, чтобы позволить разработчикам создавать мультимодальные агентные интерфейсы.
Запись прямой трансляции
Авторы
Руководители исследований
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Участники
Исследования
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Инженерная разработка
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Продукт
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Руководители и спонсоры
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry
Полный текст статьи читайте на OpenAI
