Темы



Трудности и возможности синтетических голосов: обзор

oai-synthetic-voices.png?w=1600&h=900&fi

Мы делимся выводами предварительного мелкомасштабного тестирования Voice Engine — модели для создания пользовательских голосов.

Компания OpenAI стремится к разработке безопасного и приносящего широкую пользу ИИ⁠. Сегодня мы делимся предварительными результатами и выводами мелкомасштабного тестирования модели под названием Voice Engine. Она использует текстовый ввод и всего один 15-секундный аудиофрагмент для генерации естественной речи, которая очень похожа на голос оригинального спикера. Примечательно, что небольшая модель на основе столь короткого образца способна создавать эмоциональный и реалистичный голос.

Мы разработали Voice Engine еще в конце 2022 года и с тех пор используем ее для создания предустановленных голосов в API Text-to-Speech⁠, а также в функциях ChatGPT Voice и Read Aloud⁠. В то же время мы подходим к более широкому выпуску этой технологии с осторожностью и пониманием потенциальных рисков ее неправомерного использования. Мы надеемся начать диалог об ответственном внедрении синтетических голосов и о том, как общество может адаптироваться к этим новым возможностям. Основываясь на обсуждениях и результатах мелкомасштабных тестов, мы примем взвешенное решение о том, стоит ли и как именно масштабировать эту технологию.

Первые сценарии применения Voice Engine

Чтобы лучше понять потенциальные варианты использования технологии, в конце прошлого года мы запустили закрытое тестирование с небольшой группой проверенных партнеров. Нас впечатлили проекты, которые они создали. Эти мелкомасштабные внедрения помогают нам сформировать подход, правила безопасности и понимание того, как Voice Engine может приносить пользу в различных отраслях. Вот лишь несколько примеров:

  • Обучение чтению детей и тех, кто только учится читать, с помощью естественных, эмоциональных голосов, охватывающих гораздо более широкий диапазон спикеров, чем стандартные предустановленные голоса. Компания Age of Learning⁠, занимающаяся образовательными технологиями и академическим успехом детей, использует эту модель для создания заранее подготовленного контента с озвучкой. Они также задействуют Voice Engine и GPT‑4 для генерации персонализированных ответов в реальном времени при общении со студентами. Благодаря этой технологии компания смогла расширить библиотеку материалов для более широкой аудитории.
  • Перевод контента, такого как видео и подкасты, позволяющий авторам и компаниям охватывать больше людей по всему миру на их родных языках и с сохранением собственных голосов. Одним из первых пользователей стала платформа визуального сторителлинга HeyGen⁠, которая помогает корпоративным клиентам создавать кастомные человекоподобные аватары для различных задач — от маркетинга продуктов до демонстрации продаж. Они используют Voice Engine для перевода видео, что позволяет переводить речь спикера на разные языки и взаимодействовать с глобальной аудиторией. При переводе Voice Engine сохраняет аутентичный акцент исходного спикера: например, при генерации английской речи по аудиозаписи француза на выходе получится английский с французским акцентом.
  • Поддержка глобальных сообществ путем улучшения предоставления жизненно важных услуг в отдаленных регионах. Организация Dimagi⁠ разрабатывает инструменты для медицинских работников на местах, помогающие оказывать базовую помощь, в том числе консультации для кормящих матерей. Чтобы помочь таким сотрудникам совершенствовать свои навыки, Dimagi использует Voice Engine и GPT‑4 для предоставления интерактивной обратной связи на родном языке каждого работника, включая суахили или менее формальные наречия, такие как шенг (популярный в Кении смешанный язык).
  • Помощь людям, не владеющим устной речью, например, в виде терапевтических приложений для лиц с речевыми нарушениями и образовательных инструментов для учащихся с особыми потребностями. Livox⁠, приложение для альтернативной коммуникации на базе ИИ, поддерживает работу устройств альтернативной и дополнительной коммуникации (AAC), помогающих людям с ограниченными возможностями общаться. Благодаря Voice Engine они могут предложить невербальным пользователям уникальные и нероботизированные голоса на множестве языков. Пользователи могут выбрать голос, который лучше всего им подходит, а многоязычные пользователи — сохранять постоянный голос независимо от языка общения.
  • Восстановление голоса у пациентов с внезапными или дегенеративными речевыми патологиями. Институт неврологии Нормана Принса при системе здравоохранения Lifespan⁠ (некоммерческой организации, которая является главной учебной базой медицинской школы Университета Брауна) изучает применение ИИ в клинических условиях. Они запустили пилотную программу, предлагающую Voice Engine пациентам с онкологическими или неврологическими причинами нарушения речи. Поскольку Voice Engine требует совсем короткого аудиофрагмента, врачи Фатима Мирза (Fatima Mirza), Рохаид Али (Rohaid Ali) и Константина Свокос (Konstantina Svokos) смогли восстановить голос молодой пациентки, потерявшей способность к свободному общению из-за сосудистой опухоли головного мозга, используя запись из школьного видеопроекта.

Безопасная разработка Voice Engine

Мы осознаем, что генерация голосов, похожих на человеческие, несет в себе серьезные риски, которые особенно актуальны в год выборов. Мы взаимодействуем с американскими и международными партнерами из правительств, сферы СМИ, индустрии развлечений, образования, гражданского общества и других секторов, чтобы учитывать их отзывы в процессе работы. Партнеры, тестирующие Voice Engine сегодня, согласились соблюдать наши правила использования⁠, которые запрещают выдавать себя за другого человека или организацию без согласия или законных оснований. Кроме того, наши соглашения с этими партнерами требуют получения явно выраженного и осознанного согласия от оригинального спикера, и мы не разрешаем разработчикам создавать инструменты, позволяющие индивидуальным пользователям генерировать собственные голоса. Партнеры также обязаны четко сообщать своей аудитории, что слышимый ими голос создан с помощью искусственного интеллекта. Наконец, мы внедрили комплекс мер безопасности, включая водяные знаки для отслеживания происхождения любого аудио, созданного с помощью Voice Engine, а также упреждающий мониторинг его использования. Мы убеждены, что любое масштабное внедрение технологии синтеза речи должно сопровождаться механизмами проверки голоса, подтверждающими, что первоначальный спикер осознанно добавляет свой голос в сервис, а также списком запрещенных голосов, который обнаруживает и предотвращает создание голосов, слишком похожих на известных людей.

Взгляд в будущее

Voice Engine — продолжение нашего стремления исследовать технические рубежи и открыто делиться тем, что становится возможным благодаря ИИ. В соответствии с нашим подходом к безопасности ИИ⁠ и нашими добровольными обязательствами⁠, мы решили выпустить предварительную версию этой технологии, но пока воздерживаемся от ее широкого релиза. Мы надеемся, что этот предварительный просмотр Voice Engine не только подчеркнет ее потенциал, но и покажет необходимость укрепления устойчивости общества к вызовам, которые несут все более убедительные генеративные модели. В частности, мы рекомендуем следующие шаги:

  • Отказ от голосовой аутентификации в качестве меры безопасности для доступа к банковским счетам и другой конфиденциальной информации
  • Разработку политик по защите использования голосов людей в сфере ИИ
  • Повышение осведомленности общественности о возможностях и ограничениях технологий ИИ, включая риск появления вводящего в заблуждение контента
  • Ускорение разработки и внедрения методов отслеживания происхождения аудио- и видеоконтента, чтобы всегда было понятно, общаетесь ли вы с реальным человеком или с искусственным интеллектом

Людям по всему миру важно понимать, куда движется эта технология — независимо от того, выпустим ли мы ее в итоге широким тиражом самостоятельно или нет. Мы с нетерпением ждем продолжения диалога с политиками, исследователями, разработчиками и авторами контента о проблемах и возможностях синтетических голосов.

Полный текст статьи читайте на OpenAI