Подробнее о принципах работы Voice Engine и наших исследованиях безопасности

Знакомство с технологией, лежащей в основе нашей модели синтеза речи.

Abstract painting with a mix of pastel colors, including pink, orange, purple, and green, resembling a vibrant landscape.

Мы делимся дополнительной информацией о том, как работает Voice Engine и каковы результаты наших исследований в области безопасности, чтобы держать всех в курсе нашего прогресса. Voice Engine — это модель, способная создавать пользовательские голоса.

Людям по всему миру важно понимать, куда движется эта технология, независимо от того, будем ли мы в итоге широко внедрять ее самостоятельно или нет. Именно поэтому мы хотим объяснить, как устроена эта модель, как мы используем ее для исследований и обучения, а также какие меры безопасности мы вокруг нее реализуем. Voice Engine пока недоступна широкой публике.

Как работает Voice Engine

Функция генерации речи работает на базе модели преобразования текста в речь (TTS), способной создавать звучащий по-человечески аудиоконтент на основе только текста и 15-секундного образца речи. 

Система TTS создается путем помощи модели в понимании нюансов речи на основе связанных аудиозаписей и расшифровок. Модель учится прогнозировать наиболее вероятные звуки, которые произнесет говорящий для заданной текстовой расшифровки, принимая во внимание различные голоса, акценты и стили речи. После этого модель может генерировать не только озвученные версии текста, но и речевые высказывания, которые отражают то, как их произнесли бы различные типы дикторов.

После этого для генерации аудио с помощью модели TTS требуется лишь 15-секундный образец голоса спикера и соответствующий текст. Модель не дообучается под какого-то конкретного спикера, какая-либо кастомизация модели не требуется. Вместо этого в ней используется диффузионный процесс: он начинается со случайного шума и постепенно очищает его от шумов, чтобы максимально точно соответствовать тому, как текст произнес бы говорящий из 15-секундного аудиофрагмента.

Мы разрабатываем эту модель уже больше года

Впервые мы разработали Voice Engine в конце 2022 года. На ранних этапах, чтобы оценить возможности и ограничения нашей модели Voice Engine, мы тестировали ее внутри компании, используя комбинацию общедоступных и частных голосовых образцов. Этот внутренний прототип имел решающее значение для наших исследований в области выравнивания и безопасности, помогал нам совершенствовать средства защиты и стал продолжением нашего стремления исследовать технологические рубежи.

Важно отметить, что эти результаты использовались исключительно для внутреннего тестирования, а не для обучения моделей, лежащих в основе наших продуктов.

В рамках нашей концепции поэтапного внедрения этот ранний прототип также сыграл важную роль в том, чтобы помочь политикам осознать возможности моделей синтеза речи. Например, начиная с прошлого лета, мы демонстрировали возможности этой технологии мировым лидерам и политикам высшего уровня и обсуждали с ними связанные с ней риски. 

В сентябре 2023 года мы задействовали Voice Engine для работы функции голосового режима (Voice Mode) в ChatGPT. Поскольку эти возможности также несли в себе новые риски, мы запустили их только для этого конкретного сценария использования. Голосовой режим был создан исключительно на основе реальных голосов, тщательно отобранных в ходе детального процесса, начавшегося в мае 2023 года при участии профессиональных актеров озвучки, актерских агентств, кастинг-директоров и отраслевых экспертов.

В ноябре 2023 года мы выпустили простой API текст-в-речь (TTS API), также работающий на базе Voice Engine. Мы снова выбрали ограниченный релиз: совместно с профессиональными актерами озвучки мы создали 15-секундные аудиосемплы для каждого из шести предустановленных голосов в API. Разработчики могут внедрять их в свои сайты, например, чтобы озвучивать тексты блога.

В марте текущего года мы представили предварительную версию возможностей Voice Engine по созданию пользовательских голосов для небольшой группы проверенных партнеров. Эта инициатива была направлена на повышение осведомленности о возможностях синтетических голосов и поддержку следующих целей:

  • Постепенный отказ от голосовой аутентификации в качестве меры безопасности для доступа к банковским счетам и другой конфиденциальной информации
  • Изучение политик защиты голосов частных лиц в эпоху ИИ
  • Просвещение общественности для понимания возможностей и ограничений технологий искусственного интеллекта, включая вероятность появления вводящего в заблуждение ИИ-контента
  • Ускорение разработки и внедрения методов отслеживания происхождения аудиовизуального контента, чтобы всегда было понятно, общаетесь ли вы с реальным человеком или с ИИ

Эти мелкомасштабные внедрения также помогают нам сформировать подход, средства защиты и видение того, как Voice Engine может приносить пользу в различных отраслях.

Безопасная разработка Voice Engine — наш главный приоритет

Мы продолжаем взаимодействовать с партнерами из США и других стран — представителями правительств, СМИ, индустрии развлечений, образования, гражданского общества и других сфер, — чтобы учитывать их отзывы в процессе создания.

Партнеры, тестирующие Voice Engine, согласились соблюдать правила использования, которые запрещают выдавать себя за других людей без их согласия, требуют явно выраженного одобрения исходного спикера, а также обязывают уведомлять слушателей о том, что голос сгенерирован ИИ. Кроме того, для отслеживания и контроля использования технологии применяются такие меры безопасности, как водяные знаки и проактивный мониторинг.

Безопасность синтетических голосов в будущем

Омнимодели, такие как GPT‑4o со встроенными аудиовозможностями, обеспечивают новый уровень взаимодействия, который был недоступен прошлым моделям вроде Voice Engine. Мы также понимаем, что аудиальная модальность GPT‑4o несет в себе ряд новых рисков, особенно в сфере генерации голоса. Мы активно тестируем GPT‑4o на предмет уязвимостей (red-teaming), чтобы выявлять и устранять как известные, так и непредвиденные риски в различных областях, таких как социальная психология, предвзятость, справедливость и дезинформация. Мы закладываем многоуровневые системы защиты: дорабатываем поведение моделей, адаптируем существующие текстовые системы под архитектуру GPT‑4o и разрабатываем новые классификаторы.

В соответствии с нашим осторожным подходом к выпуску Voice Engine, для общего релиза мы ограничим аудиовыход GPT‑4o набором предустановленных голосов. Эти голоса были получены от профессиональных актеров озвучки, отобранных в ходе тщательного кастинга. Мы поделимся дополнительной информацией об аудиорисках и мерах противодействия им в грядущей системной карте (system card) для GPT‑4o.

Автор

OpenAI

Полный текст статьи читайте на OpenAI