1,054 models · refreshed nightly
Automatic speech recognition models
Every model in the catalog with its licence, estimated VRAM and daily-tracked downloads. Filters update the URL — share any view.
| # | Model | Params | Context | Commercial use | 30d | Min VRAM |
|---|---|---|---|---|---|---|
| 51 | faster-whisper-large-v3 | — | — | ✓ mit | 1.0 M | — |
| 52 | wav2vec2-xlsr-nepali | — | — | ✓ apache-2.0 | 993 K | — |
| 53 | wav2vec2-large-xlsr-korean | 320 M | — | ✓ apache-2.0 | 983 K | from 1.9 GB |
| 54 | cohere-transcribe-03-2026-gguf | — | — | ✓ apache-2.0 | 963 K | from 2.2 GB |
| 55 | wav2vec2-xls-r-300m-ftspeech | 320 M | — | other | 949 K | from 1.9 GB |
| 56 | wav2vec2-large-xlsr-mvc-swahili | 320 M | — | ✓ apache-2.0 | 845 K | from 1.9 GB |
| 57 | whisper-tiny.en | — | — | ✓ apache-2.0 | 805 K | — |
| 58 | faster-whisper-small.en | — | — | ✓ mit | 769 K | — |
| 59 | faster-whisper-medium | — | — | ✓ mit | 761 K | — |
| 60 | nemotron-3.5-asr-streaming-0.6b | 640 M | — | other | 752 K | from 1.4 GB |
| 61 | wav2vec2-large-xlsr-catala | — | — | ✓ apache-2.0 | 747 K | — |
| 62 | VibeVoice-ASR | 8.7 B | — | ✓ mit | 740 K | from 20.9 GB |
| 63 | parakeet-ctc-1.1b | 1.1 B | — | ✓ cc-by-4.0 | 721 K | from 2.0 GB |
| 64 | wav2vec2-large-xlsr-malayalam | — | — | ✓ apache-2.0 | 649 K | — |
| 65 | wav2vec2-large-xlsr-53-arabic | — | — | ✓ apache-2.0 | 623 K | — |
| 66 | Qwen3-ASR-0.6B | 940 M | — | ✓ apache-2.0 | 603 K | from 2.7 GB |
| 67 | parakeet-tdt-0.6b-v3 | 630 M | — | ✓ cc-by-4.0 | 586 K | from 1.4 GB |
| 68 | parakeet-tdt-0.6b-v3-gguf | — | — | ✓ cc-by-4.0 | 580 K | from 1.0 GB |
| 69 | wav2vec2-large-xlsr-lithuanian | — | — | ✓ apache-2.0 | 572 K | — |
| 70 | wav2vec2-large-xls-r-300m-welsh | 300 M | — | ✓ apache-2.0 | 567 K | from 1.2 GB |
| 71 | wav2vec2-xls-r-300m-cv7-turkish | 300 M | — | ✓ cc-by-4.0 | 558 K | from 1.2 GB |
| 72 | whisper-bemba-stt | 240 M | — | unknown | 535 K | from 1.6 GB |
| 73 | whisper-medium-gguf | — | — | ✓ apache-2.0 | 533 K | from 1.1 GB |
| 74 | faster-whisper-base.en | — | — | ✓ mit | 526 K | — |
| 75 | wav2vec2-large-xlsr-53-estonian | — | — | ✓ apache-2.0 | 523 K | — |
| 76 | distil-large-v3 | 760 M | — | ✓ mit | 523 K | from 5.6 GB |
| 77 | wav2vec2-xls-r-300m-sk-cv8 | 300 M | — | ✓ apache-2.0 | 505 K | from 1.2 GB |
| 78 | wav2vec2-large-xlsr-japanese-hiragana | 320 M | — | ✓ apache-2.0 | 472 K | from 1.9 GB |
| 79 | faster-whisper-tiny.en | — | — | ✓ mit | 469 K | — |
| 80 | wav2vec2-large-xls-r-300m-sinhala-low-LR-part1 | 320 M | — | unknown | 469 K | from 1.9 GB |
| 81 | wav2vec2-large-xlsr-53-basque | 320 M | — | ✓ apache-2.0 | 468 K | from 1.9 GB |
| 82 | wav2vec2-xlsr-khmer | — | — | ✓ apache-2.0 | 458 K | — |
| 83 | vakyansh-wav2vec2-sanskrit-sam-60 | — | — | unknown | 449 K | — |
| 84 | wav2vec2-large-xlsr-kn | — | — | ✓ apache-2.0 | 447 K | — |
| 85 | Voxtral-Mini-4B-Realtime-2602-gguf | — | — | ✓ apache-2.0 | 442 K | from 3.6 GB |
| 86 | indic-conformer-600m-multilingual | 600 M | — | ✓ mit | 436 K | from 1.9 GB |
| 87 | whisper-large-v3-turbo-german | 810 M | — | ✓ apache-2.0 | 428 K | from 2.4 GB |
| 88 | wav2vec2-large-mms-1b-azerbaijani-common_voice15.0 | 960 M | — | ✗ cc-by-nc-4.0 | 427 K | from 4.9 GB |
| 89 | wav2vec2-large-xls-r-300m-bg-d2 | 300 M | — | ✓ apache-2.0 | 419 K | from 1.2 GB |
| 90 | nemotron-speech-streaming-en-0.6b | 618 M | — | other | 417 K | from 1.4 GB |
| 91 | Qwen3-ForcedAligner-0.6B | 920 M | — | ✓ apache-2.0 | 417 K | from 2.7 GB |
| 92 | wav2vec2-large-xlsr-53-slovenian | — | — | ✓ apache-2.0 | 402 K | — |
VRAM figures are estimates for the smallest available quantization at 8K context — see /methodology. Downloads refresh nightly from the Hugging Face API.