Как в Descript разработали масштабируемый инструмент для многоязычного видеодубляжа

Используя модели логического вывод OpenAI, компания Descript внедрила автоматическую локализацию крупных библиотек контента без потери тайминга и смысла.

Начать разработку
Descript logo and wordmark over a pink and purple abstract waveform background.
Размер компании: Стартап
Регион: Северная Америка
Отрасль: Технологии
Продукты: API

Результаты

43

Процентных пункта улучшения соблюдения длительности с помощью OpenAI

Результаты

15%

Рост числа экспортов с дубляжом после запуска

Descript — это видеоредактор с поддержкой ИИ, созданный на основе простой идеи: если вы умеете редактировать текст, вы сможете редактировать и видео. С самого начала существования Descript искусственный интеллект лежал в основе каждого аспекта продукта: расшифровки, редактирования, очистки аудио и всё более сложных творческих рабочих процессов. Они годами использовали технологии OpenAI, применяя Whisper для расшифровки и модели серии GPT в своем соредакторе Underlord. 

Перевод быстро стал востребованным сценарием использования, оказывающим огромное влияние. Традиционно перевод видео был медленным и дорогостоящим процессом, требующим привлечения языковых экспертов для управления проектами, выполнения рутинного перевода, контроля качества и создания соответствующего звукового сопровождения. Большие языковые модели (LLM) кардинально оптимизируют этот рабочий процесс, делая высококачественный перевод доступным в больших масштабах.

И субтитры, и дубляж требуют семантической точности: перевод должен сохранять исходный смысл. Однако соблюдение длительности играет в них разную роль. Для субтитров это приятное дополнение. Для дубляжа это критически важно, поскольку если переведенная речь звучит слишком долго или слишком быстро, она будет казаться неестественной, даже при правильном смысле.

Чтобы решить эту проблему, в Descript переработали конвейер перевода, задействовав модели логического вывода OpenAI для оптимизации семантической точности и соблюдения таймингов непосредственно в процессе генерации, а не после него. За первые 30 дней после запуска количество экспортов переведенных видео с дубляжом выросло на 15%, а точность соблюдения длительности увеличилась на 13–43 процентных пункта в зависимости от языка.

«Дубляж становится всё более популярным сценарием использования Descript, поэтому мы разрабатываем способы его пакетного выполнения для компаний, которые хотят переводить и озвучивать с синхронизацией губ целые библиотеки контента», — отметила Лора Буркхаузер (Laura Burkhauser), генеральный директор компании.

Где дубляж начинал давать сбои

Перевод был одной из самых ранних и запрашиваемых функций в Descript. Они начали с перевода только субтитров, и это работало отлично, но многие пользователи хотели пойти дальше и получить звучащую речь (дубляж) на целевом языке.

Однако постоянно всплывала одна проблема: дублированный звук не всегда звучал правильно. «Пожалуй, главной жалобой было то, что темп речи на переведенном языке звучал неестественно», — рассказал Алекс Мистратов (Aleks Mistratov), руководитель направления ИИ-продуктов в Descript.

Проблема заключалась в том, что на выражение одной и той же мыслей на разных языках уходит разное количество времени. В Descript заметили, например, что в среднем немецкий язык «длиннее» английского. Чтобы уложиться в фиксированные видеофрагменты, переведенную речь часто приходилось искусственно ускорять или замедлять. «В итоге получалось что-то похожее на бурундуков или сонного великана», — пояснил Мистратов.

Английский:

Немецкий:

«Please review the safety guidelines before operating the machine.»

Слогов: 18

«Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.»

Слогов: 24 (увеличение на 40%)

В этом случае немецкое аудио пришлось бы либо неестественно ускорять, либо переписывать перевод так, чтобы он укладывался в отведенное время.

У пользователей оставалось два варианта: вручную изменять тайминг каждого аудиосегмента или переписывать сам перевод, чтобы добиться соответствия. Оба подхода требовали глубокого редактирования таймлайна и часто почти свободного владения целевым языком. Это было утомительно для создателей контента и становилось препятствием для масштабирования функции на крупные корпоративные проекты по локализации.

Оптимизация переводов с учетом тайминга, а не только смысла

У команды было четкое представление о том, что потребуется для успешной работы дубляжа. Система должна была не просто оптимизировать семантический смысл, но и учитывать ограничения по времени. Например, при переводе с английского на немецкий модель должна была понимать, как использовать меньше слов или упростить концепцию, чтобы дублированный звук оставался естественным.

Предыдущие подходы сначала оптимизировали семантическую точность, а затем пытались исправить тайминг. Переводы часто были правильными по смыслу, но они регулярно не укладывались в ограничения по длительности, и общее качество всё еще оставалось недостаточно высоким. 

«Мы проводили поэтапные тесты, даже ничего не генерируя, а просто прося модель выдать количество слогов в фрагменте текста», — рассказал Мистратов. — «Предыдущие модели просто не справлялись с этим должным образом».

Надежный подсчет слогов оказался критически важным. Если модель не могла стабильно рассчитывать слоги, она не могла надежно ориентироваться на конкретное окно длительности.

Модели серии GPT-5 обеспечили такой уровень логической согласованности, которого не хватало более ранним моделям, особенно в таких задачах, как подсчет слогов и отслеживание ограничений. Благодаря этому улучшению в Descript переработали конвейер перевода и дубляжа.

Во-первых, система Descript разбивает расшифровку на фрагменты, ориентируясь на границы предложений, естественные паузы и речевые паттерны в исходной записи. Каждый фрагмент сохраняет семантическую непрерывность, но при этом достаточно мал, чтобы его можно было рассматривать как единицу тайминга.

Затем модель вычисляет количество слогов во фрагменте. Используя допущения о скорости речи для конкретного языка, система оценивает, на какое количество слогов должен быть ориентирован переведенный фрагмент, чтобы сохранить естественный темп («соблюдение длительности»). Промпт предписывает модели оптимизировать как соблюдение длительности, так и сохранение смысла. Соседние фрагменты передаются в качестве контекста, чтобы модель сохраняла семантическую когерентность между сегментами.

Команда оценила множество конфигураций для достижения баланса между соблюдением длительности, семантической точностью, задержкой и стоимостью. Выбранная установка обеспечила строгое соблюдение ограничений на производственной скорости, что позволило осуществлять масштабный перевод без ручной корректировки таймингов. В результате получился конвейер перевода, в котором темп рассматривается как первостепенная переменная, а не то, что исправляется постфактум.

Определение и измерение естественного темпа

Для разработки критериев приемки при оценке качества команда провела прослушивания: они генерировали образцы переведенного аудио и с небольшим шагом регулировали скорость воспроизведения, прося пользователей оценить, в какой момент речь начинает звучать неестественно. 

«Всё, что было замедленно на 10% или ускорено на 20%, в целом всё еще звучало естественно», — сказал Мистратов. За пределами этого диапазона речь становилась слишком искаженной. 

Предыдущие системы показывали плохие результаты по этому критерию. В зависимости от языка, только 40–60% сегментов попадали в допустимое окно темпа. С обновленным конвейером этот показатель вырос с 40–60% до 73–83% в зависимости от языка.

Команда также оценила семантическую точность с помощью отдельной модели-судьи по шкале от 1 («полное различие») до 5 («семантический эквивалент»). Для дубляжа они решили принять более низкий семантический порог, чем для перевода только субтитров, где ограничения по длительности не имеют значения. Даже с учетом этого компромисса 85,5% сегментов получили оценку четыре или пять из пяти за семантическую приверженность оригиналу.

В результате получилась система, способная балансировать между двумя конкурирующими ограничениями — таймингом и смыслом — с измеримой уверенностью. И поскольку обе метрики были автоматизированы, Descript может непрерывно оценивать новые выпуски моделей и вариации промптов по одним и тем же бенчмаркам.

Масштабная локализация видео становится реальностью

Поскольку перевод переходит от отдельных видео к крупным библиотекам контента, Descript закладывает больше возможностей управления настройкой переводов, включая опцию приоритизации более строгой семантической точности при необходимости.

Перевод внутри Descript — это лишь один из слоев более широкой мультимодальной системы. Переведенный текст поступает в модуль генерации речи, который затем управляет синхронизацией губ и финальным рендерингом видео. 

Улучшения на уровне текста делают возможным естественный темп, но общий результат также зависит от того, насколько хорошо аудиомодель сохраняет тон, каденс и невербальные характеристики речи. В этом команда видит следующий рубеж. 

«Значительная часть того, что улучшит качество перевода, заключается в переходе к более мультимодальному конвейеру: объединении аудио, видео и текста при принятии решений о переводе», — отметил Мистратов. — «Это позволит лучше сохранять невербальные характеристики речи, такие как тон и интонационный акцент, а также передавать еще большую часть оригинальной манеры исполнения».

Для Descript более мощные модели логического вывода сделали сложность дубляжа управляемой. Преодолев порог, на котором модели смогли надежно балансировать между темпом и смыслом, команда превратила перевод в задачу, которую можно систематически совершенствовать и развертывать в больших масштабах.

OpenAI <3 startups

Присоединиться к сообществуНачать разработку

Полный текст статьи читайте на OpenAI