Развитие речевого интеллекта с новыми моделями в API
Новое поколение моделей голосового общения в реальном времени, способных рассуждать, переводить и расшифровывать речь по мере ее произнесения.
Мы представляем три аудиомодели в API, которые открывают новый класс голосовых приложений для разработчиков. С помощью этих моделей разработчики могут создавать голосовые интерфейсы, которые звучат естественнее, реагируют умнее и выполняют действия в реальном времени:
- GPT‑Realtime‑2 — наша первая голосовая модель с возможностями рассуждения уровня GPT‑5, способная справляться со сложными запросами и поддерживать беседу естественным образом.
- GPT‑Realtime‑Translate — новая модель синхронного перевода, которая переводит речь с более чем 70 входных языков на 13 выходных, не отставая от говорящего.
- GPT‑Realtime‑Whisper — новая потоковая модель преобразования речи в текст, которая транскрибирует речь в реальном времени по мере того, как пользователь говорит.
После запуска сеанса попробуйте произнести одну из следующих фраз:
- Я устраиваю ужин в последнюю минуту. У меня есть 30 минут, два вегетарианца, один нелюбитель грибов и крошечная кухня. Помоги мне составить простое меню.
- Я приветствую гостей на живом мероприятии в Японии. Скажи теплое, естественное приветствие на японском языке — так, будто ведущий открывает что-то особенное.
- Номер моего заказа — Orbit-742Q. Повтори его четко, чтобы я мог убедиться, что он правильный.
- Помоги мне отрепетировать объявление для команды о том, что мы достигли важной вехи запуска. Сначала скажи это с тихой уверенностью, а затем с большим энтузиазмом.
- Я планирую викторину для поездки на автомобиле. Дай мне три каверзных вопроса, которые звучат обманчиво просто, а затем объясни каждый ответ одним предложением.
Эта демонстрация ограничена по времени. Используя ее, вы соглашаетесь с условиями OpenAI и подтверждаете ознакомление с нашей политикой конфиденциальности.
Голос становится одним из самых естественных способов взаимодействия людей с программным обеспечением. Он позволяет пользователю попросить о помощи за рулем, изменить планы поездки во время прогулки по аэропорту, получить поддержку на предпочитаемом языке или выполнить задачу без необходимости останавливаться для набора текста.
Однако создание полезных голосовых продуктов требует большего, чем просто быстрый обмен репликами или естественно звучащий голос. Голосовому агенту необходимо понимать смысл сказанного, отслеживать контекст, исправлять ошибки при изменении запроса, использовать инструменты по ходу беседы и реагировать способом, который соответствует текущему моменту.
В совокупности выпускаемые нами модели переводят работу с аудио в реальном времени из плоскости простых вопросов и ответов в плоскость голосовых интерфейсов, способных реально выполнять работу: слушать, рассуждать, переводить, расшифровывать и действовать по мере развития разговора.
Голос как интерфейс между людьми и продуктами
Поскольку голос становится все более естественным способом использования ПО, мы наблюдаем, как разработчики создают приложения на основе трех новых паттернов голосового ИИ:
- Голос-к-действию (Voice-to-action), когда пользователи могут описать свои потребности, а система способна обдумать запрос, использовать инструменты и выполнить задачу. Например, Zillow создает ассистента, который может слушать, анализировать и выполнять запросы вроде: «найди дома в рамках моей покупательской способности, избегай оживленных улиц и запланируй просмотр на субботу».
- Системы-в-голос (Systems-to-voice), когда программное обеспечение может преобразовывать контекст в голосовые подсказки в реальном времени. Например, приложение для путешествий может проактивно сообщить путешественнику: «Ваш стыковочный рейс задерживается, но вы все еще можете успеть на пересадку. Я нашел новый выход на посадку, проложил самый быстрый маршрут по терминалу, и ваш багаж по-прежнему должен успеть на перегрузку».
- Голос-к-голосу (Voice-to-voice), когда ИИ может помогать продолжать живые разговоры через языковые барьеры, задачи или меняющийся контекст. Например, Deutsche Telekom создает голосовые службы поддержки, где клиенты могут говорить на том языке, на котором им удобнее всего общаться, в то время как модель переводит разговор в реальном времени.
Эти паттерны также могут работать в комбинации. Priceline работает над созданием будущего, в котором путешественники смогут управлять целыми поездками с помощью голоса: искать авиабилеты и отели в режиме беседы, решать такие задачи, как изменение бронирования отеля после задержки рейса или получение актуальной информации о времени ожидания в очередях Управления транспортной безопасности (TSA), а также переводить разговоры, когда путешественники прибывают на место.
Голос в реальном времени: помогаем голосовым моделям рассуждать и действовать
GPT‑Realtime‑2 создана для живого голосового взаимодействия, в котором модель поддерживает беседу, одновременно обдумывая запрос, вызывая инструменты, обрабатывая исправления или прерывания и реагируя в соответствии с текущей ситуацией.
- Вступительные фразы (Preambles): Разработчики могут включать короткие фразы перед основным ответом, такие как «позвольте мне проверить это» или «одну минуту, я посмотрю», чтобы пользователи знали, что агент работает над запросом.
- Параллельные вызовы инструментов и прозрачность действий: Модель может вызывать несколько инструментов одновременно и озвучивать эти действия с помощью фраз вроде «проверяю ваш календарь» или «ищу это», помогая агентам оставаться отзывчивыми при выполнении задач.
- Улучшенное восстановление после сбоев: Модель способна более изящно выходить из затруднительных ситуаций, произнося фразы вроде «у меня сейчас возникают проблемы с этим», вместо того чтобы безмолвно завершать работу или прерывать разговор.
- Более длинный контекст для агентских рабочих процессов: Мы увеличиваем размер контекстного окна с 32 тыс. до 128 тыс. токенов для поддержки более длительных, логичных сеансов и сложных цепочек задач.
- Улучшенное понимание предметной области: Модель лучше удерживает специализированную терминологию, собственные имена, медицинские термины и другую лексику, важную в рабочей среде.
- Более управляемые тон и подача: Модель может точнее регулировать свой тон — говорить спокойно при решении проблемы, эмпатично, когда пользователь расстроен, или бодро при подтверждении успешного выполнения действия.
- Регулируемая глубина рассуждений: Теперь разработчики могут выбирать уровни рассуждений минимальный (minimal), низкий (low), средний (medium), высокий (high) и сверхвысокий (xhigh), причем низкий (low) используется по умолчанию, что позволяет находить баланс между низкой задержкой для простых взаимодействий и более глубокими рассуждениями для сложных запросов.
Прирост производительности заметен по результатам аудиооценок, тесно связанных с реальными голосовыми агентами: GPT‑Realtime‑2 (с высоким уровнем рассуждений) набирает на 15,2% больше баллов в тесте Big Bench Audio для аудиоинтеллекта по сравнению с GPT‑Realtime‑1.5. Модель GPT‑Realtime‑2 (со сверхвысоким уровнем) превосходит GPT‑Realtime‑1.5 на 13,8% в бенчмарке Audio MultiChallenge на выполнение инструкций, демонстрируя более развитые навыки рассуждения, управления контекстом и контроля в живых диалогах.
Big Bench Audio оценивает сложные возможности рассуждения в языковых моделях, поддерживающих аудиовход. Audio MultiChallenge оценивает многооборотный разговорный интеллект в системах речевого диалога, включая выполнение инструкций, интеграцию контекста, самосогласованность и обработку естественных речевых исправлений.
Магия GPT‑Realtime‑2 проявляется в самых разных сценариях использования:
Во время раннего тестирования компании использовали GPT‑Realtime‑2 для создания голосовых агентов, которые помогают клиентам и сотрудникам справляться с задачами в ходе естественного разговора:
Синхронный перевод: создание многоязычных голосовых интерфейсов в реальном времени
GPT‑Realtime‑Translate помогает разработчикам создавать интерактивные многоязычные голосовые приложения, в которых каждый участник может говорить на предпочитаемом языке, слышать перевод беседы в реальном времени и читать синхронные расшифровки. Модель поддерживает более 70 входных и 13 выходных языков, что делает ее полезной для службы поддержки, трансграничных продаж, образования, мероприятий, медиа и платформ для авторов контента, работающих с глобальной аудиторией.
Для разработчиков живой перевод должен сохранять смысл и не отставать от говорящего — даже когда люди говорят естественно, переключают контекст или используют региональное произношение и специфичную для предметной области лексику. Например, Deutsche Telekom тестирует модель для многоязычного голосового общения, где низкая задержка и высокая степень беглости могут сделать межъязыковое общение более естественным.
В этом видео Vimeo показывает, как GPT‑Realtime‑Translate может переводить обучающее видео о продукте прямо во время воспроизведения, позволяя клиентам по всему миру слышать обновления на предпочитаемом языке без ожидания отдельно созданной версии.
Транскрипция в реальном времени: создание низколатентных инструментов распознавания речи
GPT‑Realtime‑Whisper — это новая потоковая модель транскрипции, созданная для преобразования речи в текст с низким уровнем задержки. Она расшифровывает аудио по мере того, как люди говорят, делая живые приложения более быстрыми, отзывчивыми и естественными — от субтитров, появляющихся в моменте, до заметок встреч, успевающих за ходом разговора.
Модель позволяет использовать живую речь непосредственно в бизнес-процессах по мере их выполнения. Команды могут создавать субтитры для встреч, лекций, трансляций и мероприятий; генерировать заметки и резюме прямо во время разговоров; создавать голосовые агенты, которым необходимо непрерывно понимать пользователей;, а также организовывать более быстрые последующие рабочие процессы для службы поддержки, здравоохранения, продаж, подбора персонала и других высокоинтенсивных речевых взаимодействий.
Безопасность
Realtime API включает в себя несколькоуровней средств защиты и снижения рисков, помогающих предотвратить злоупотребления. Мы используем активные классификаторы для сеансов Realtime API, что означает, что определенные разговоры могут быть прерваны, если будет обнаружено нарушение наших правил в отношении вредоносного контента. Разработчики также могут легко добавлять собственные дополнительные защитные механизмы с помощью Agents SDK.
Наши правила использования запрещают перепрофилирование или распространение результатов работы наших сервисов для спама, введения в заблуждение или других вредоносных целей. Разработчики также должны четко давать понять конечным пользователям, когда они взаимодействуют с искусственным интеллектом, если это не очевидно из контекста.
Realtime API полностью поддерживает контроль локализации данных в ЕС для приложений на базе в ЕС и подпадает под действие наших обязательств по обеспечению конфиденциальности корпоративного уровня.
Цены и доступность
GPT‑Realtime‑2, GPT‑Realtime‑Translate и GPT‑Realtime‑Whisper доступны в Realtime API. Стоимость GPT‑Realtime‑2 составляет $32 за 1 млн входных аудиотокенов ($0,40 за кэшированные входные токены) и $64 за 1 млн выходных аудиотокенов. Стоимость GPT‑Realtime‑Translate составляет $0,034 за минуту. Стоимость GPT‑Realtime‑Whisper составляет $0,017 за минуту.
Начало работы
Вы можете протестировать новые голосовые модели реального времени в песочнице (Playground).
Чтобы начать разработку, откройте этот промпт в Codex, чтобы добавить GPT‑Realtime‑2 в существующее приложение или создать новое. Если у вас еще нет Codex, сначала загрузите приложение Codex.
Автор
Полный текст статьи читайте на OpenAI
