Fine-Tune MMS Adapter Models for low-resource ASR

Practical AI: Tools, Models & Frameworksfine-tune

What changed

Wav2Vec2 is a pretrained model for Automatic Speech Recognition (ASR) and was released in September 2020 by Alexei Baevski, Michael Auli, and Alex Conneau. Over 1,100 spoken languages can be identified, transcribed and generated with the various language identification, speech recognition, and text-to-speech checkpoints released. Three MMS checkpoints fine-tuned for speech recognition (ASR) have been released.

Why it matters

A concrete addition to Practical AI: Tools, Models & Frameworks: it changes what's available to builders today rather than being general commentary.

How it compares

Related prior coverage to compare against:

  • Fine-Tune W2V2-Bert for low-resource ASR with ๐Ÿค— Transformers
  • Fine-Tune XLSR-Wav2Vec2 for low-resource ASR with ๐Ÿค— Transformers
  • Fine-Tune Whisper For Multilingual ASR with ๐Ÿค— Transformers

Sources