Представляем Whisper

Мы обучили и выложили в открытый доступ нейросеть под названием Whisper, которая по надежности и точности распознавания английской речи приближается к человеческому уровню.

Читать научную статьюПосмотреть кодПосмотреть карточку модели

Эта публикация представляет Whisper (2022 год).

Актуальные возможности работы со звуком и транскрипцией:

Изучить модели

Whisper — это система автоматического распознавания речи (ASR), обученная на 680 000 часах многоязычных и многозадачных контролируемых данных, собранных из интернета. Мы показываем, что использование столь масштабного и разнообразного набора данных приводит к повышению устойчивости к акцентам, фоновому шуму и технической лексике. Кроме того, это обеспечивает возможность транскрипции на нескольких языках, а также перевода с этих языков на английский. Мы открываем исходный код моделей и код вывода, чтобы они служили основой для создания полезных приложений и дальнейших исследований в области надежной обработки речи.

ASR Summary Of Model Architecture

Архитектура Whisper представляет собой простой подход «от конца до конца» (end-to-end), реализованный в виде трансформера кодер-декодер. Входной аудиосигнал разбивается на 30-секундные фрагменты, преобразуется в лог-мел-спектрограмму и передается в кодер. Декодер обучается предсказывать соответствующий текстовый фрагмент вперемешку со специальными токенами, которые направляют единую модель на выполнение таких задач, как определение языка, временные метки на уровне фраз, многоязычная транскрипция речи и перевод речи на английский язык.

Diagram detailing how ASR models are trained

Другие существующие подходы часто используют меньшие, более тесно связанные наборы данных для обучения пар «аудио-текст», 12, 3 или применяют широкое, но неконтролируемое предварительное аудиообучение.4, 5, 6 Поскольку Whisper обучался на большом и разнообразном наборе данных и не был дообучен (fine-tuned) на каком-то одном конкретном, он не превосходит модели, специализирующиеся на показателях LibriSpeech — известного конкурентного бенчмарка в области распознавания речи. Однако, когда мы измеряем производительность Whisper в режиме zero-shot (без предварительного обучения на конкретной задаче) на множестве разнообразных наборов данных, мы обнаруживаем, что она гораздо надежнее и совершает на 50% меньше ошибок, чем те модели.

Около трети аудиоданных Whisper не на английском языке, и модели попеременно ставится задача транскрипции на исходном языке или перевода на английский. Мы обнаружили, что этот подход особенно эффективен при обучении переводу речи в текст и превосходит контролируемый уровень современного состояния дел (SOTA) на бенчмарке CoVoST2 для перевода на английский язык в режиме zero-shot.

Мы надеемся, что высокая точность и простота использования Whisper позволят разработчикам добавлять голосовые интерфейсы к гораздо более широкому спектру приложений. Ознакомьтесь с научной статьей,  карточкой модели и кодом, чтобы узнать подробности и опробовать Whisper в деле.

Ссылки

  1. 1

    Chan, W., Park, D., Lee, C., Zhang, Y., Le, Q., and Norouzi, M. SpeechStew: Simply mix all available speech recogni- tion data to train one large neural network. arXiv preprint arXiv:2104.02133,  2021.

  2. 2

    Galvez, D., Diamos, G., Torres, J.M. C., Achorn, K., Gopi, A., Kanter, D., Lam, M., Mazumder, M., and Reddi, V.J. The people«s speech: A large-scale diverse english speech recognition dataset for commercial usage. arXiv preprint arXiv:2111.09344,  2021.

  3. 3

    Chen, G., Chai, S., Wang, G., Du, J., Zhang, W.-Q., Weng, C., Su, D., Povey, D., Trmal, J., Zhang, J., et al. Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio. arXiv preprint arXiv:2106.06909,  2021.

  4. 4

    Baevski, A., Zhou, H., Mohamed, A., and Auli, M. wav2vec 2.0: A framework for self-supervised learning of speech representations. arXiv preprint arXiv:2006.11477,  2020.

  5. 5

    Baevski, A., Hsu, W.N., Conneau, A., and Auli, M. Unsu pervised speech recognition. Advances in Neural Information Processing Systems, 34:27826–27839,  2021.

  6. 6

    Zhang, Y., Park, D. S., Han, W., Qin, J., Gulati, A., Shor, J., Jansen, A., Xu, Y., Huang, Y., Wang, S., et al. BigSSL: Exploring the frontier of large-scale semi-supervised learning for automatic speech recognition. arXiv preprint arXiv:2109.13226,  2021.

Полный текст статьи читайте на OpenAI