Audio Text To Text Models
Tracked audio text to text models monitored by OpenModelStats. Rankings below compare tracked models against each other — see the methodology for scope and limitations.
- Top-10 combined DL 30D
- 1.2M
- Tasks directory position
- See all tasks
- Growth history
- Available
- Last refresh
- Sep 22, 2026
Trending now
| # | Model | Task | DL 30D | 7D | Likes | Params |
|---|---|---|---|---|---|---|
| 1 | MOSS-Transcribe-DiarizeOpenMOSS-Team | Audio Text To Text | 219.6K | 8.0%(up) | ||
| 2 | music-flamingo-hfnvidia | Audio Text To Text | 4,235 | 0.9%(up) | ||
| 3 | Voxtral-Small-24B-2507mistralai | Audio Text To Text | 21.9K | 0.4%(up) | ||
| 4 | Qwen2-Audio-7B-InstructQwen | Audio Text To Text | 288.4K | 1.4%(up) | ||
| 5 | MOSS-Music-8B-InstructOpenMOSS-Team | Audio Text To Text | 3,291 | 12.4%(up) | ||
| 6 | MOSS-Audio-4B-InstructOpenMOSS-Team | Audio Text To Text | 16K | 1.4%(up) | ||
| 7 | GaussianMindBAAI | Audio Text To Text | 66 | — | ||
| 8 | audio-flamingo-3-hfnvidia | Audio Text To Text | 52.2K | 1.1%(up) | ||
| 9 | SynapseMusicV12-TranscriberSYNAPSEai1 | Audio Text To Text | 28 | — | ||
| 10 | cavernicolabrecha-soluciones-ds | Audio Text To Text | 0 | — |
Most downloaded
| Model | Task | DL 30D | 7D | Likes | Params |
|---|---|---|---|---|---|
| MOSS-Music-8B-Instruct-GGUFscragnog | Audio Text To Text | 385.8K | 12.6%(up) | ||
| Qwen2-Audio-7B-InstructQwen | Audio Text To Text | 288.4K | 1.4%(up) | ||
| MOSS-Transcribe-DiarizeOpenMOSS-Team | Audio Text To Text | 219.6K | 8.0%(up) | ||
| ultravox-v0_5-llama-3_2-1bfixie-ai | Audio Text To Text | 135.1K | 0.4%(up) | ||
| VibeVoice-ASR-HFmicrosoft | Audio Text To Text | 69K | 0.8%(up) | ||
| audio-flamingo-3-hfnvidia | Audio Text To Text | 52.2K | 1.1%(up) | ||
| Qwen2-Audio-7BQwen | Audio Text To Text | 34.8K | 0.9%(up) | ||
| Voxtral-Small-24B-2507mistralai | Audio Text To Text | 21.9K | 0.4%(up) | ||
| music-flamingo-2601-hfnvidia | Audio Text To Text | 18K | 0.9%(up) | ||
| midashenglm-7b-0804-fp32mispeech | Audio Text To Text | 16.2K | 0.5%(up) |
Fastest growing
Downloads gained over the last seven tracked days.
| Model | Task | DL 30D | 7D7D gained | Likes | Params |
|---|---|---|---|---|---|
| Qwen2-Audio-7B-InstructQwen | Audio Text To Text | 288.4K | +97.4K | ||
| MOSS-Transcribe-DiarizeOpenMOSS-Team | Audio Text To Text | 219.6K | +41.7K | ||
| ultravox-v0_5-llama-3_2-1bfixie-ai | Audio Text To Text | 135.1K | +37.2K | ||
| audio-flamingo-3-hfnvidia | Audio Text To Text | 52.2K | +16K | ||
| VibeVoice-ASR-HFmicrosoft | Audio Text To Text | 69K | +15.7K | ||
| Qwen2-Audio-7BQwen | Audio Text To Text | 34.8K | +7,817 | ||
| Qwen2.5-Omni-3B-Audio-CoreAImlboydaisuke | Audio Text To Text | 10.9K | +5,258 | ||
| music-flamingo-2601-hfnvidia | Audio Text To Text | 18K | +5,203 | ||
| audio-flamingo-next-captioner-hfnvidia | Audio Text To Text | 14.7K | +4,210 | ||
| MOSS-Audio-4B-InstructOpenMOSS-Team | Audio Text To Text | 16K | +4,195 |
New & notable
Published within the last 90 days with meaningful traction.
| Model | Task | DL 30D | 7D7D gained | Likes | Params | Published |
|---|---|---|---|---|---|---|
| MOSS-Music-8B-Instruct-GGUFscragnog | Audio Text To Text | 385.8K | +383 | Aug 16, 2026 | ||
| MOSS-Transcribe-Diarize-HFitazap | Audio Text To Text | 2,573 | +1,360 | Sep 7, 2026 | ||
| acestep-captioner-GGUFdernet | Audio Text To Text | 694 | +16 | Sep 4, 2026 | ||
| mistralai_Voxtral-Small-24B-2507-GGUFAbu-Dju | Audio Text To Text | 362 | +55 | Aug 4, 2026 | ||
| Sori-1Bsnkii | Audio Text To Text | 307 | +2 | Aug 28, 2026 | ||
| A2R-30B-A3BPleasedPenguin | Audio Text To Text | 134 | +26 | Aug 26, 2026 |