Представляем GPT‑Live

Новое поколение голосовых моделей для естественного взаимодействия человека с ИИ, которое теперь лежит в основе ChatGPT Voice.

Обновление от 31 июля 2026 г.: Сгенерированный аудиоконтент, созданный с помощью GPT‑Live через ChatGPT Voice и OpenAI API, теперь содержит водяные знаки SynthID. Наш инструмент публичной верификации теперь может обнаруживать сигналы происхождения от OpenAI в поддерживаемых аудиофайлах. Мы также добавили API-доступ для верификации, чтобы разработчики и организации могли встроить проверку происхождения в свои собственные рабочие процессы. Эти обновления дополняют подход к безопасности, описанный ниже, и нашу более масштабную работу по упрощению идентификации контента, созданного OpenAI.

Мы запускаем GPT‑Live — новое поколение голосовых моделей, с которыми общение с ИИ становится гораздо больше похоже на настоящий диалог.

GPT‑Live построена на архитектуре полного дуплекса (full-duplex), что означает её способность слушать и говорить одновременно. Во время разговора GPT‑Live может показывать вовлеченность с помощью таких реплик, как «угу» или «ага», вести динамичный диалог или просто молчать, когда вам нужно время подумать. В результате получается голосовой интерфейс, общаться с которым невероятно легко и приятно.

Кроме того, GPT‑Live — наша самая умная голосовая модель на сегодняшний день. Для вопросов, требующих веб-поиска, глубоких рассуждений или более сложной работы, она фоново перенаправляет задачу на нашу передовую модель и возвращает результат в разговор, когда он готов. Пока идет обработка, GPT‑Live может продолжать общаться с вами и поддерживать ход беседы. На момент запуска в качестве фоновой модели в GPT‑Live будет использоваться GPT‑5.5. По мере выпуска новых передовых моделей мы будем непрерывно обновлять модель, используемую в GPT‑Live.

Эти достижения лежат в основе нового голосового интерфейса ChatGPT, который стал более интеллектуальным и естественным в использовании. Мы верим, что со временем эти исследования также откроют возможность использовать голос для выполнения всё более сложных, долгосрочных и автономных задач.

Мы начинаем развертывание двух версий GPT‑Live — GPT‑Live‑1 и GPT‑Live‑1 mini — для пользователей ChatGPT по всему миру. Вскоре мы также планируем внедрить их в API, и разработчики с предприятиями могут подписаться на уведомления с помощью этой формы.

Вступление в новую эру взаимодействия человека и ИИ

Наша цель — обеспечить по-настоящему естественное взаимодействие человека и ИИ: создать мир, в котором сотрудничество с искусственным интеллектом ощущается таким же плавным и отзывчивым, как работа с другим человеком, в то время как рассуждения и выполнение сложных задач происходят незаметно в фоновом режиме.

Предыдущие подходы

Предыдущие поколения голосовых ИИ-систем приближали нас к этой цели, но были связаны с серьезными компромиссами.

Каскадные голосовые системы

Каскадные голосовые системы полагаются на цепочку моделей, работающих последовательно для обработки каждого речевого хода. Оригинальная версия ChatGPT Voice объединяла три модели: модель преобразования речи в текст (speech-to-text) для транскрипции вашей речи, большую языковую модель для генерации ответа и модель преобразования текста в речь (text-to-speech) для его озвучивания. Этот подход впервые позволил нам разговаривать с передовыми моделями ИИ, но сложность архитектуры имела свою цену: информация могла теряться при передаче между моделями, а ответы были медленными и неестественными.

Каскадная голосовая система

Медленные и скованные ответы, длинные паузы

STT
GPT-5.5
TTS
STT
GPT-5.5
TTS
Пример разговора в стандартном голосовом режиме (Standard Voice Mode) с использованием GPT-5.5 Instant

Пошаговые (turn-based) голосовые модели

Пошаговые голосовые модели, такие как ChatGPT Advanced Voice Mode, обрабатывали и генерировали аудио в рамках единой модели, что снизило задержки и сделало разговор более плавным. Тем не менее они по-прежнему функционировали в режиме дискретных реплик (ходов). Модели приходилось ждать, пока пользователь закончит говорить, прежде чем ответить, из-за чего диалог выглядел жестким и схематичным. Кроме того, поскольку определение конца реплики основано на тишине, даже кратковременная пауза или фоновый шум могли быть ошибочно приняты за завершение фразы — в результате модель перебивала собеседника в самые неподходящие моменты.

Пошаговая голосовая модель

Немного более быстрые и плавные ответы, но обмен репликами с моделью всё ещё ощущается жестким

Пример разговора в режиме ChatGPT Advanced Voice Mode

Наш новый подход

GPT‑Live решает эти ограничения за счет двух архитектурных изменений.

Непрерывное взаимодействие

Во-первых, мы создали GPT‑Live для непрерывного взаимодействия, используя полнодуплексную архитектуру. Вместо обработки последовательности отдельных сообщений GPT‑Live непрерывно обрабатывает входные данные в процессе генерации ответа. Благодаря этому модель может принимать решения о характере взаимодействия много раз в секунду: говорить ли самой, продолжать слушать, сделать паузу, перебить или задействовать инструмент.

Это позволяет модели вести более естественный диалог, лучше чувствовать время и даже осуществлять синхронный перевод на лету.

Непрерывное взаимодействие

Быстрые, естественные, выразительные ответы и более активное слушание

Пользователь
GPT-Live-1
Пример разговора с GPT-Live-1 с использованием GPT-5.5 Instant

Делегирование для более сложной работы

Во-вторых, мы отделили GPT‑Live (которая отвечает за непрерывное взаимодействие) от выполнения более сложных задач. Когда вопрос требует поиска, рассуждений или расширенных возможностей агента, GPT‑Live может перепоручить задачу другой модели, например GPT‑5.5. Это позволяет ей поддерживать разговор даже при выполнении нескольких фоновых задач.

Это архитектурное изменение также позволяет GPT‑Live непрерывно задействовать новейшие модели и агентов, объединяя передовой интеллект с естественным взаимодействием.

Делегирование для более сложной работы

GPT-Live обеспечивает быстрые и естественные ответы, пока GPT-5.5 выполняет поиск в фоне

Пользователь
GPT-Live-1
GPT-5.5
Поиск + рассуждения
Пример разговора с GPT-Live-1 с использованием GPT-5.5 Instant

Оценки

Мы разработали новые критерии оценки с участием людей для измерения степени комфорта и плавности беседы. В ходе прямых сравнений (A/B-тестирования) пользователи отдали явное предпочтение GPT‑Live‑1 и GPT‑Live‑1 mini по сравнению с Advanced Voice Mode в парных 5–10-минутных разговорах, оценивая общие впечатления, очередность реплик, прерывания, плавность диалога и естественность каждого взаимодействия.

  • GPQA: модель GPT‑Live‑1 существенно превосходит Advanced Voice Mode в тесте GPQA, который оценивает экспертный уровень научных рассуждений в области биологии, химии и физики.
  • BrowseComp: GPT‑Live‑1 демонстрирует значительный прирост по сравнению с Advanced Voice Mode в тесте BrowseComp, проверяющем возможности агентного веб-поиска и способность находить труднодоступную информацию.
  • τ³-Voice Telecom (внутренний вариант)**: GPT‑Live‑1 превосходит Advanced Voice Mode в тесте τ³-Voice Telecom, оценивающем голосовых агентов в реалистичных многошаговых сценариях техподдержки телекоммуникаций.

* GPT‑Live‑1 (instant) и GPT‑Live‑1 mini используют в основе модель GPT‑5.5 Instant, в то время как GPT‑Live‑1 Medium и GPT‑Live‑1 High используют модель GPT‑5.5 Thinking со средним и высоким уровнем рассуждений.

** Для этой оценки мы использовали кастомную пользовательскую модель на базе наших новейших моделей с рассуждениями.

Новый голосовой интерфейс ChatGPT

Каждую неделю более 150 миллионов человек общаются с ChatGPT, используя такие функции, как «Голос» и «Диктовка». Они применяют их для повседневной помощи без помощи рук, практики иностранных языков, прослушивания сказок на ночь или просто для беседы по дороге на работу.

Начиная с сегодняшнего дня, при нажатии кнопки голосового общения с ChatGPT вы получаете улучшенный опыт на базе GPT‑Live: более естественные беседы, более умные ответы, улучшенное распознавание речи и визуальные отклики.

Более естественные беседы

Общение с ChatGPT теперь во многом напоминает настоящий разговор. Вы можете прервать модель вопросом, сделать паузу, чтобы собрать мысли, или попросить ChatGPT говорить медленнее. Бот естественным образом реагирует на ваши слова фразами вроде «угу» или «понятно», давая понять, что он следит за ходом беседы. Мы также полностью обновили девять уникальных голосов ChatGPT для работы с GPT‑Live.

Более умные ответы

Голосовой режим ChatGPT теперь опирается на наши новейшие передовые модели, обеспечивая вас более интеллектуальными ответами тогда, когда это необходимо. Вы также можете выбрать уровень рассуждений под свои задачи: Instant (Мгновенный) для быстрых ответов либо Medium (Средний) и High (Высокий), если хотите, чтобы ChatGPT потратил больше времени на размышления.

Лучшее восприятие речи на слух

Если вам требуется минута на раздумья, голосовой режим ChatGPT теперь выжидает паузу вместо того, чтобы сразу вклиниваться в разговор. Если вы попросите его помолчать и послушать, он так и поступит. А в условиях фонового шума — например, проезжающего мимо транспорта или разговоров неподалеку — ChatGPT лучше концентрируется именно на вашем голосе, не отвлекаясь на посторонние звуки.

Наглядные визуальные ответы

Некоторые ответы гораздо полезнее воспринимать визуально. Во время разговора ChatGPT теперь может выводить наглядные информационные карточки с данными о погоде, котировках акций, спортивных результатах и многим другом. Голосовой режим по-прежнему поддерживает поиск, память, отправку изображений и загрузку файлов.

ChatGPT Voice displaying a weather forecast for Denver, Colorado.
ChatGPT Voice displaying upcoming international football matches.
ChatGPT Voice displaying a map with nearby soccer pubs.

В результате голосовой интерфейс ChatGPT стал более естественным, функциональным и полезным в повседневной жизни.

Безопасность, заложенная в основу голосового режима

Модель GPT‑Live с самого начала проектировалась как безопасное решение. Она опирается на достижения в области безопасности наших новейших моделей, дополняя их специализированным обучением для работы с ключевыми рисками и новыми средствами защиты, разработанными специально для голосового взаимодействия.

Расширенное тестирование безопасности

Чтобы точнее отражать сценарии реального использования голоса, мы начали с расширения наших тестов безопасности, добавив в них новые аудионативные оценки. Мы также создали синтетические тесты на основе сгенерированных аудиозаписей, чтобы более детально проработать ключевые аспекты безопасности, опираясь на опыт использования Advanced Voice Mode. В число таких аспектов вошли членовредительство, психозы и мании, эмоциональная зависимость от ИИ, насилие и контент сексуального характера. Внутренние эксперты также провели ред-тестирование модели на предмет рисков, уникальных для голосового формата.

В ходе тестирования GPT‑Live показала результаты на уровне Advanced Voice Mode или превосходящие его практически во всех оцениваемых областях. Подробнее о нашем тестировании и мерах защиты можно прочитать в системной карте GPT‑Live.

Встроенные механизмы защиты

Поскольку голосовые беседы разворачиваются в реальном времени, мы также создали защитные механизмы, способные действовать прямо во время речи модели. Если система обнаруживает потенциально небезопасный вывод, она может скорректировать модель в сторону более безопасного ответа, вывести дополнительные предупреждения или справочные материалы либо, в ситуациях повышенного риска, завершить голосовую сессию. При обсуждении тем, связанных с нанесением себе вреда, мы адаптировали поддерживающие сценарии ChatGPT для голоса, включая предоставление контактов проверенных экспертами кризисных линий помощи.

Мы разработали дополнительные средства защиты для несовершеннолетних пользователей и привнесли в модель соответствующее возрасту поведение для минимизации риска неуместных ответов. Родители могут решать, разрешать ли подростку использовать голосовой режим ChatGPT через «Родительский контроль», а привязанные родительские аккаунты могут получать уведомления в ситуациях повышенного риска, указывающих на признаки потенциального членовредительства или суицидальных наклонностей.

Обучение на основе реального опыта использования

Мы также внедряем долгосрочные методы оценки и мониторинг после запуска, направленные на изучение эмоциональной привязанности, чтобы лучше понимать происходящее и совершенствовать защитные меры. Опираясь на наши предыдущие исследования в области эмоционального взаимодействия и психологического благополучия, это поможет нам выявлять возникающие тенденции и улучшать реакцию системы в деликатных эмоциональных ситуациях.

Кроме того, GPT‑Live создана для полноценного общения, а не для имитации голосов конкретных людей. В ней используется фиксированный набор предустановленных голосов ChatGPT со встроенными ограничениями, предотвращающими копирование реальных человеческих голосов.

Мы стремимся поддерживать безопасность и благополучие пользователей и будем продолжать укреплять эти защитные механизмы по мере получения новых данных от реального использования.

Доступность и ограничения

GPT‑Live становится доступна пользователям ChatGPT по всему миру на iOS, Android и в ChatGPT.com. GPT‑Live‑1 станет моделью по умолчанию для голосового режима ChatGPT у пользователей тарифов Go, Plus и Pro, а GPT‑Live‑1 mini — по умолчанию для пользователей бесплатной версии (Free). Более подробную информацию о доступности можно найти в нашем правовом центре помощи.

Мы оптимизировали GPT‑Live для некоторых из самых популярных языков в ChatGPT. Для ряда языков у модели может наблюдаться неродной акцент или некоторая нехватка беглости речи. Мы активно работаем над улучшением качества во всех поддерживаемых языках.

На момент запуска GPT‑Live пока не поддерживает голосовое общение с использованием видео или демонстрации экрана в ChatGPT, но мы работаем над тем, чтобы внедрить эти возможности в ближайшем будущем. Вы по-прежнему можете использовать предыдущие версии голосового режима ChatGPT, включая Standard и Advanced Voice Mode, где эти функции доступны.

Автор

OpenAI

Полный текст статьи читайте на OpenAI