1,011 models · refreshed nightly
Automatic speech recognition models
Every model in the catalog with its licence, estimated VRAM and daily-tracked downloads. Filters update the URL — share any view.
| # | Model | Params | Context | Commercial use | 30d | Min VRAM |
|---|---|---|---|---|---|---|
| 51 | vakyansh-wav2vec2-tamil-tam-250 | — | — | ✓ mit | 752 K | — |
| 52 | wav2vec2-xls-r-300m-mixed | — | — | unknown | 720 K | — |
| 53 | parakeet-tdt-0.6b-v2 | — | — | ✓ cc-by-4.0 | 719 K | — |
| 54 | VibeVoice-ASR | 8.7 B | — | ✓ mit | 695 K | from 20.9 GB |
| 55 | nb-wav2vec2-1b-nynorsk | 960 M | — | ✓ apache-2.0 | 693 K | from 4.9 GB |
| 56 | whisper-tiny | — | — | unknown | 679 K | — |
| 57 | wav2vec2-large-xlsr-53-finnish | — | — | ✓ apache-2.0 | 665 K | — |
| 58 | wav2vec2-base-vi-vlsp2020 | — | — | ✗ cc-by-nc-4.0 | 665 K | — |
| 59 | wav2vec2-xls-r-300m-bengali | — | — | ✓ apache-2.0 | 622 K | — |
| 60 | whisper-tiny.en | — | — | ✓ apache-2.0 | 614 K | — |
| 61 | parakeet-tdt-0.6b-v3-gguf | — | — | ✓ cc-by-4.0 | 606 K | from 1.0 GB |
| 62 | nb-wav2vec2-1b-bokmaal-v2 | 960 M | — | ✓ apache-2.0 | 581 K | from 4.9 GB |
| 63 | Phi-4-multimodal-instruct | 5.6 B | 131 K | ✓ mit | 572 K | from 15.4 GB |
| 64 | wav2vec2-xls-r-parlaspeech-hr | 320 M | — | unknown | 564 K | from 1.9 GB |
| 65 | whisper-bemba-stt | 240 M | — | unknown | 546 K | from 1.6 GB |
| 66 | wav2vec2-xlsr-nepali | — | — | ✓ apache-2.0 | 542 K | — |
| 67 | granite-speech-3.3-2b | 3.0 B | — | ✓ apache-2.0 | 529 K | from 13.9 GB |
| 68 | whisper-medium-gguf | — | — | ✓ apache-2.0 | 518 K | from 1.1 GB |
| 69 | faster-whisper-medium | — | — | ✓ mit | 514 K | — |
| 70 | wav2vec2-xls-r-300m-ftspeech | 320 M | — | other | 512 K | from 1.9 GB |
| 71 | wav2vec2-xls-r-300m-cv7-turkish | — | — | ✓ cc-by-4.0 | 490 K | — |
| 72 | wav2vec2-large-xlsr-mvc-swahili | 320 M | — | ✓ apache-2.0 | 476 K | from 1.9 GB |
| 73 | wav2vec2-xlsr-53-espeak-cv-ft | — | — | ✓ apache-2.0 | 461 K | — |
| 74 | wav2vec2-large-xlsr-catala | — | — | ✓ apache-2.0 | 455 K | — |
| 75 | vakyansh-wav2vec2-sanskrit-sam-60 | — | — | unknown | 450 K | — |
| 76 | Voxtral-Mini-4B-Realtime-2602-gguf | — | — | ✓ apache-2.0 | 430 K | from 3.6 GB |
| 77 | wav2vec2-large-xlsr-53-estonian | — | — | ✓ apache-2.0 | 426 K | — |
| 78 | granite-speech-4.1-2b | 2.3 B | — | ✓ apache-2.0 | 415 K | from 6.2 GB |
| 79 | reverb-diarization-v1 | — | — | other | 413 K | — |
| 80 | wav2vec2-large-960h-lv60-self | — | — | ✓ apache-2.0 | 412 K | — |
| 81 | Qwen3-ForcedAligner-0.6B | 920 M | — | ✓ apache-2.0 | 407 K | from 2.7 GB |
| 82 | parakeet-tdt-0.6b-v3-coreml | — | — | ✓ cc-by-4.0 | 400 K | — |
| 83 | wav2vec2-large-xlsr-lithuanian | — | — | ✓ apache-2.0 | 395 K | — |
| 84 | wav2vec2-large-xlsr-kazakh | 320 M | — | ✓ apache-2.0 | 386 K | from 1.9 GB |
| 85 | wav2vec2-xls-r-300m-sk-cv8 | — | — | ✓ apache-2.0 | 383 K | — |
| 86 | speaker-diarization | — | — | ✓ mit | 373 K | — |
| 87 | GigaAM-v3 | — | — | ✓ mit | 370 K | — |
| 88 | whisper-medium | 760 M | — | ✓ apache-2.0 | 364 K | from 4.0 GB |
| 89 | wav2vec2-large-xlsr-malayalam | — | — | ✓ apache-2.0 | 350 K | — |
VRAM figures are estimates for the smallest available quantization at 8K context — see /methodology. Downloads refresh nightly from the Hugging Face API.