Представляем Whisper
Мы обучили и выложили в открытый доступ нейросеть под названием Whisper, которая по надежности и точности распознавания английской речи приближается к человеческому уровню.
Эта публикация представляет Whisper (2022 год).
Актуальные возможности работы со звуком и транскрипцией:
Whisper — это система автоматического распознавания речи (ASR), обученная на 680 000 часах многоязычных и многозадачных контролируемых данных, собранных из интернета. Мы показываем, что использование столь масштабного и разнообразного набора данных приводит к повышению устойчивости к акцентам, фоновому шуму и технической лексике. Кроме того, это обеспечивает возможность транскрипции на нескольких языках, а также перевода с этих языков на английский. Мы открываем исходный код моделей и код вывода, чтобы они служили основой для создания полезных приложений и дальнейших исследований в области надежной обработки речи.
Архитектура Whisper представляет собой простой подход «от конца до конца» (end-to-end), реализованный в виде трансформера кодер-декодер. Входной аудиосигнал разбивается на 30-секундные фрагменты, преобразуется в лог-мел-спектрограмму и передается в кодер. Декодер обучается предсказывать соответствующий текстовый фрагмент вперемешку со специальными токенами, которые направляют единую модель на выполнение таких задач, как определение языка, временные метки на уровне фраз, многоязычная транскрипция речи и перевод речи на английский язык.
Другие существующие подходы часто используют меньшие, более тесно связанные наборы данных для обучения пар «аудио-текст»,
Около трети аудиоданных Whisper не на английском языке, и модели попеременно ставится задача транскрипции на исходном языке или перевода на английский. Мы обнаружили, что этот подход особенно эффективен при обучении переводу речи в текст и превосходит контролируемый уровень современного состояния дел (SOTA) на бенчмарке CoVoST2 для перевода на английский язык в режиме zero-shot.
Мы надеемся, что высокая точность и простота использования Whisper позволят разработчикам добавлять голосовые интерфейсы к гораздо более широкому спектру приложений. Ознакомьтесь с научной статьей, карточкой модели и кодом, чтобы узнать подробности и опробовать Whisper в деле.
Ссылки
Полный текст статьи читайте на OpenAI
