Трудности и возможности синтетических голосов: обзор

Мы делимся выводами предварительного мелкомасштабного тестирования Voice Engine — модели для создания пользовательских голосов.
Компания OpenAI стремится к разработке безопасного и приносящего широкую пользу ИИ. Сегодня мы делимся предварительными результатами и выводами мелкомасштабного тестирования модели под названием Voice Engine. Она использует текстовый ввод и всего один 15-секундный аудиофрагмент для генерации естественной речи, которая очень похожа на голос оригинального спикера. Примечательно, что небольшая модель на основе столь короткого образца способна создавать эмоциональный и реалистичный голос.
Мы разработали Voice Engine еще в конце 2022 года и с тех пор используем ее для создания предустановленных голосов в API Text-to-Speech, а также в функциях ChatGPT Voice и Read Aloud. В то же время мы подходим к более широкому выпуску этой технологии с осторожностью и пониманием потенциальных рисков ее неправомерного использования. Мы надеемся начать диалог об ответственном внедрении синтетических голосов и о том, как общество может адаптироваться к этим новым возможностям. Основываясь на обсуждениях и результатах мелкомасштабных тестов, мы примем взвешенное решение о том, стоит ли и как именно масштабировать эту технологию.
Первые сценарии применения Voice Engine
Чтобы лучше понять потенциальные варианты использования технологии, в конце прошлого года мы запустили закрытое тестирование с небольшой группой проверенных партнеров. Нас впечатлили проекты, которые они создали. Эти мелкомасштабные внедрения помогают нам сформировать подход, правила безопасности и понимание того, как Voice Engine может приносить пользу в различных отраслях. Вот лишь несколько примеров:
- Обучение чтению детей и тех, кто только учится читать, с помощью естественных, эмоциональных голосов, охватывающих гораздо более широкий диапазон спикеров, чем стандартные предустановленные голоса. Компания Age of Learning, занимающаяся образовательными технологиями и академическим успехом детей, использует эту модель для создания заранее подготовленного контента с озвучкой. Они также задействуют Voice Engine и GPT‑4 для генерации персонализированных ответов в реальном времени при общении со студентами. Благодаря этой технологии компания смогла расширить библиотеку материалов для более широкой аудитории.
- Перевод контента, такого как видео и подкасты, позволяющий авторам и компаниям охватывать больше людей по всему миру на их родных языках и с сохранением собственных голосов. Одним из первых пользователей стала платформа визуального сторителлинга HeyGen, которая помогает корпоративным клиентам создавать кастомные человекоподобные аватары для различных задач — от маркетинга продуктов до демонстрации продаж. Они используют Voice Engine для перевода видео, что позволяет переводить речь спикера на разные языки и взаимодействовать с глобальной аудиторией. При переводе Voice Engine сохраняет аутентичный акцент исходного спикера: например, при генерации английской речи по аудиозаписи француза на выходе получится английский с французским акцентом.
- Поддержка глобальных сообществ путем улучшения предоставления жизненно важных услуг в отдаленных регионах. Организация Dimagi разрабатывает инструменты для медицинских работников на местах, помогающие оказывать базовую помощь, в том числе консультации для кормящих матерей. Чтобы помочь таким сотрудникам совершенствовать свои навыки, Dimagi использует Voice Engine и GPT‑4 для предоставления интерактивной обратной связи на родном языке каждого работника, включая суахили или менее формальные наречия, такие как шенг (популярный в Кении смешанный язык).
- Помощь людям, не владеющим устной речью, например, в виде терапевтических приложений для лиц с речевыми нарушениями и образовательных инструментов для учащихся с особыми потребностями. Livox, приложение для альтернативной коммуникации на базе ИИ, поддерживает работу устройств альтернативной и дополнительной коммуникации (AAC), помогающих людям с ограниченными возможностями общаться. Благодаря Voice Engine они могут предложить невербальным пользователям уникальные и нероботизированные голоса на множестве языков. Пользователи могут выбрать голос, который лучше всего им подходит, а многоязычные пользователи — сохранять постоянный голос независимо от языка общения.
- Восстановление голоса у пациентов с внезапными или дегенеративными речевыми патологиями. Институт неврологии Нормана Принса при системе здравоохранения Lifespan (некоммерческой организации, которая является главной учебной базой медицинской школы Университета Брауна) изучает применение ИИ в клинических условиях. Они запустили пилотную программу, предлагающую Voice Engine пациентам с онкологическими или неврологическими причинами нарушения речи. Поскольку Voice Engine требует совсем короткого аудиофрагмента, врачи Фатима Мирза (Fatima Mirza), Рохаид Али (Rohaid Ali) и Константина Свокос (Konstantina Svokos) смогли восстановить голос молодой пациентки, потерявшей способность к свободному общению из-за сосудистой опухоли головного мозга, используя запись из школьного видеопроекта.
Безопасная разработка Voice Engine
Мы осознаем, что генерация голосов, похожих на человеческие, несет в себе серьезные риски, которые особенно актуальны в год выборов. Мы взаимодействуем с американскими и международными партнерами из правительств, сферы СМИ, индустрии развлечений, образования, гражданского общества и других секторов, чтобы учитывать их отзывы в процессе работы. Партнеры, тестирующие Voice Engine сегодня, согласились соблюдать наши правила использования, которые запрещают выдавать себя за другого человека или организацию без согласия или законных оснований. Кроме того, наши соглашения с этими партнерами требуют получения явно выраженного и осознанного согласия от оригинального спикера, и мы не разрешаем разработчикам создавать инструменты, позволяющие индивидуальным пользователям генерировать собственные голоса. Партнеры также обязаны четко сообщать своей аудитории, что слышимый ими голос создан с помощью искусственного интеллекта. Наконец, мы внедрили комплекс мер безопасности, включая водяные знаки для отслеживания происхождения любого аудио, созданного с помощью Voice Engine, а также упреждающий мониторинг его использования. Мы убеждены, что любое масштабное внедрение технологии синтеза речи должно сопровождаться механизмами проверки голоса, подтверждающими, что первоначальный спикер осознанно добавляет свой голос в сервис, а также списком запрещенных голосов, который обнаруживает и предотвращает создание голосов, слишком похожих на известных людей.
Взгляд в будущее
Voice Engine — продолжение нашего стремления исследовать технические рубежи и открыто делиться тем, что становится возможным благодаря ИИ. В соответствии с нашим подходом к безопасности ИИ и нашими добровольными обязательствами, мы решили выпустить предварительную версию этой технологии, но пока воздерживаемся от ее широкого релиза. Мы надеемся, что этот предварительный просмотр Voice Engine не только подчеркнет ее потенциал, но и покажет необходимость укрепления устойчивости общества к вызовам, которые несут все более убедительные генеративные модели. В частности, мы рекомендуем следующие шаги:
- Отказ от голосовой аутентификации в качестве меры безопасности для доступа к банковским счетам и другой конфиденциальной информации
- Разработку политик по защите использования голосов людей в сфере ИИ
- Повышение осведомленности общественности о возможностях и ограничениях технологий ИИ, включая риск появления вводящего в заблуждение контента
- Ускорение разработки и внедрения методов отслеживания происхождения аудио- и видеоконтента, чтобы всегда было понятно, общаетесь ли вы с реальным человеком или с искусственным интеллектом
Людям по всему миру важно понимать, куда движется эта технология — независимо от того, выпустим ли мы ее в итоге широким тиражом самостоятельно или нет. Мы с нетерпением ждем продолжения диалога с политиками, исследователями, разработчиками и авторами контента о проблемах и возможностях синтетических голосов.
Полный текст статьи читайте на OpenAI
