Как Tolan создает голосовой ИИ с помощью GPT‑5.1

С помощью GPT‑5.1 команда Tolan создала голосовое приложение, оптимизированное для низкой задержки, точного учета контекста и стабильности характеров по мере развития бесед.

Tolan logo on orange jigsaw puzzle background

Tolan — это голосовой ИИ-компаньон, где пользователи общаются с персонализированным анимированным персонажем, который со временем учится на основе разговоров. 

Приложение, созданное компанией Portola (опытной командой с успешным предыдущим стартапом за плечами), разработано для продолжительного открытого диалога, а не для быстрых запросов и ответов. «Мы увидели взлет ChatGPT и поняли, что голосовой интерфейс — это следующий рубеж», — говорит Квинтен Фармер (Quinten Farmer), соучредитель и генеральный директор Portola. — «Но голос сложнее. Вы не просто отвечаете на напечатанные запросы; вы ведете живую, извилистую беседу».

Голосовой ИИ повышает требования к задержке и управлению контекстом, но он также открывает возможности для более глубоких и исследовательских взаимодействий по сравнению с текстом. 

Поскольку базовые модели становятся быстрее, дешевле и мощнее, команда сосредоточила свои усилия на двух ключевых рычагах: памяти и дизайне персонажей. Компания Portola создала вселенную на основе персонажей, сформированную при участии отмеченных наградами аниматоров и писателя-фантаста, используя систему управления контекстом в реальном времени для поддержания стабильности личности и памяти по ходу беседы.

Выход моделей GPT‑5.1 стал поворотным моментом, обеспечив значительный прирост в управляемости и уменьшении задержек, что позволило объединить эти элементы в единое целое и создать более отзывчивый и увлекательный голосовой опыт.

«GPT-5.1 дала нам такую степень управляемости, которая наконец-то позволила воплотить задуманных нами персонажей. Модель стала не просто умнее — она точнее передавала тон и характер, которые мы хотели создать.»
— Квинтен Фармер, генеральный директор Portola

Проектирование естественных голосовых взаимодействий

Архитектура Tolan обусловлена требованиями голосового формата. Пользователи голосовых сервисов ожидают мгновенных и естественных ответов, даже если тема разговора меняется на ходу. Платформа Tolan должна была реагировать быстро, отслеживать смену тем и сохранять стабильность характера без задержек и искажения тона.

Чтобы общение казалось естественным, требовалась практически нулевая задержка. Внедрение OpenAI GPT‑5.1 и Responses API сократило время инициализации речи более чем на 0,7 секунды — этого достаточно, чтобы заметно улучшить динамику разговора.

Не менее критичным было то, как система обрабатывает контекст. В отличие от многих агентов, которые кэшируют промпты на протяжении нескольких реплик, Tolan воссоздает свое окно контекста с нуля на каждом шаге. Каждая реконструкция контекста подтягивает сводку недавних сообщений, карточку персонажа, извлеченные из векторной базы воспоминания, рекомендации по тону и сигналы приложения в реальном времени. такая архитектура позволяет Tolan мгновенно адаптироваться к резким сменам тем, что является важнейшим требованием для естественного голосового взаимодействия.

«Мы быстро поняли, что кэшированные промпты просто не справляются», — говорит Квинтен. — «Пользователи постоянно меняют темы. Чтобы всё выглядело бесшовно, система должна адаптироваться прямо на лету».

Этот подход с реконструкцией в реальном времени является технически сложным и в то же время фундаментальным для успеха Tolan.

Flow diagram showing Tolan’s conversational loop. A

Создание памяти и характера, сохраняющих целостность с течением времени

Управление контекстом важно, но его оказалось недостаточно, чтобы поддерживать связность бесед с течением времени. Для поддержки долгих нелинейных разговоров компания Tolan создала систему памяти, которая сохраняет не только факты и предпочтения, но и эмоциональные сигналы («вайб») — подсказки, помогающие направлять реакцию персонажа Tolan.

Воспоминания эмбеддятся с помощью модели OpenAI text-embedding-3-large и хранятся в Turbopuffer — высокоскоростной векторной базе данных, обеспечивающей время поиска менее 50 мс. Эта скорость имеет решающее значение для голосовых взаимодействий в реальном времени. На каждом шаге Tolan использует последнее сообщение пользователя и синтезированные системой вопросы (например, «На ком женат пользователь?»), чтобы инициировать извлечение воспоминаний. Для поддержания высокого качества памяти Tolan запускает ночную задачу сжатия, которая удаляет маловажные или избыточные записи (например, «сегодня пользователь пил кофе») и разрешает противоречия.

Характером управляют столь же тщательно. Каждый персонаж Tolan создается на основе уникального каркаса личности, написанного штатным писателем-фантастом компании и доработанного поведенческим исследователем. Эти основы придают персонажам последовательность, а также гибкость для адаптации с течением времени, развиваясь вместе с пользователем. 

Параллельная система отслеживает эмоциональный тон разговора и динамически корректирует манеру общения Tolan. Это позволяет персонажу плавно переходить от игривого тона к более серьезному в зависимости от сигналов пользователя, не теряя при этом своей основной индивидуальности. 

Переход на GPT‑5.1 стал поворотным моментом. Внезапно многоуровневые инструкции в промптах — каркасы тона, внедрение воспоминаний, черты характера — стали выполняться гораздо точнее. Промпты, которые раньше требовали обходных путей, начали работать именно так, как задумывалось. 

«Впервые наши внутренние эксперты почувствовали, что модель действительно слушает», — говорит Квинтен. — «Инструкции оставались неизменными на протяжении долгих бесед, черты личности уважались, и мы наблюдали гораздо меньше отклонений от заданного образа».

Эти изменения в совокупности обеспечили более последовательный и правдоподобный характер, что, в свою очередь, создало более увлекательный пользовательский опыт. Команда Tolan увидела четкие, измеримые результаты: количество сбоев при извлечении воспоминаний снизилось на 30% (на основе сигналов разочарования внутри продукта), а удержание пользователей на следующий день выросло более чем на 20% после запуска персонажей на базе GPT‑5.1.

Flow diagram illustrating how Tolan retrieves and refines memories during conversation. A user message (

Основные принципы Tolan по созданию естественных голосовых агентов 

По мере развития Tolan сформировался ряд принципов, которые теперь определяют подход команды к созданию и развитию голосовой архитектуры:

  • Проектируйте с учетом изменчивости разговора: Голосовые беседы могут менять направление прямо посреди предложения. Системы должны переключаться столь же быстро, чтобы оставаться естественными.
  • Рассматривайте задержку как часть пользовательского опыта: Отклик быстрее секунды определяет, воспринимается ли голосовой агент как собеседник или как механическая система.
  • Создавайте память как систему поиска, а не как стенограмму: Высококачественное сжатие и быстрый векторный поиск обеспечивают более стабильный характер, чем избыточно большие окна контекста.
  • Воссоздавайте контекст на каждом шаге: Не боритесь с отклонениями с помощью громоздких промптов. Регенерация контекста на каждом шаге удерживает агентов в нужном русле по мере того, как разговор делает новые повороты.

В совокупности эти уроки формируют фундамент для следующего этапа инноваций Tolan и задают направление развития голосового ИИ в целом.

Расширение возможностей голосового ИИ

С момента запуска в феврале 2025 года аудитория Tolan выросла до более чем 200 000 активных пользователей в месяц. Рейтинг в 4,8 звезды и более 100 000 отзывов в App Store подчеркивают, насколько успешно система поддерживает последовательность в длинных и изменчивых разговорах. Один из рецензентов отметил: «Они помнят вещи, о которых мы говорили два дня назад, и возвращают их в беседу, которую мы ведем сегодня».

Эти показатели напрямую связаны с лежащей в основе архитектурой: низкая задержка вызовов моделей, пошаговая реконструкция контекста, а также модульные системы памяти и персонажей. Вместе они позволяют Tolan отслеживать смену тем, сохранять тон и обеспечивать точность ответов без необходимости опираться на громоздкие и хрупкие промпты.

Заглядывая в будущее, Tolan планирует наращивать инвестиции в управляемость и совершенствование памяти, сосредоточив усилия на более плотном сжатии, улучшенной логике извлечения данных и расширенной настройке персонажей. Долгосрочная цель состоит в том, чтобы расширить границы того, чем может быть голосовой интерфейс: сделать его не просто отзывчивым, но и контекстно-осведомленным и динамичным в общении.

«Следующий рубеж, — говорит Квинтен, — это создание голосовых агентов, которые не просто реагируют на запросы, а являются по-настоящему мультимодальными и способны объединять голос, зрение и контекст в единую управляемую систему».

Полный текст статьи читайте на OpenAI