Audio Text To Text Models

Tracked audio text to text models monitored by OpenModelStats. Rankings below compare tracked models against each other — see the methodology for scope and limitations.

Top-10 combined DL 30D
1.2M
Tasks directory position
See all tasks
Growth history
Available
Last refresh
Sep 22, 2026

Trending now

#ModelDL 30D7D
1MOSS-Transcribe-DiarizeOpenMOSS-Team219.6K8.0%(up)
2music-flamingo-hfnvidia4,2350.9%(up)
3Voxtral-Small-24B-2507mistralai21.9K0.4%(up)
4Qwen2-Audio-7B-InstructQwen288.4K1.4%(up)
5MOSS-Music-8B-InstructOpenMOSS-Team3,29112.4%(up)
6MOSS-Audio-4B-InstructOpenMOSS-Team16K1.4%(up)
7GaussianMindBAAI66—
8audio-flamingo-3-hfnvidia52.2K1.1%(up)
9SynapseMusicV12-TranscriberSYNAPSEai128—
10cavernicolabrecha-soluciones-ds0—

Most downloaded

ModelDL 30D7D
MOSS-Music-8B-Instruct-GGUFscragnog385.8K12.6%(up)
Qwen2-Audio-7B-InstructQwen288.4K1.4%(up)
MOSS-Transcribe-DiarizeOpenMOSS-Team219.6K8.0%(up)
ultravox-v0_5-llama-3_2-1bfixie-ai135.1K0.4%(up)
VibeVoice-ASR-HFmicrosoft69K0.8%(up)
audio-flamingo-3-hfnvidia52.2K1.1%(up)
Qwen2-Audio-7BQwen34.8K0.9%(up)
Voxtral-Small-24B-2507mistralai21.9K0.4%(up)
music-flamingo-2601-hfnvidia18K0.9%(up)
midashenglm-7b-0804-fp32mispeech16.2K0.5%(up)

Fastest growing

Downloads gained over the last seven tracked days.

ModelDL 30D7D
Qwen2-Audio-7B-InstructQwen288.4K+97.4K
MOSS-Transcribe-DiarizeOpenMOSS-Team219.6K+41.7K
ultravox-v0_5-llama-3_2-1bfixie-ai135.1K+37.2K
audio-flamingo-3-hfnvidia52.2K+16K
VibeVoice-ASR-HFmicrosoft69K+15.7K
Qwen2-Audio-7BQwen34.8K+7,817
Qwen2.5-Omni-3B-Audio-CoreAImlboydaisuke10.9K+5,258
music-flamingo-2601-hfnvidia18K+5,203
audio-flamingo-next-captioner-hfnvidia14.7K+4,210
MOSS-Audio-4B-InstructOpenMOSS-Team16K+4,195

New & notable

Published within the last 90 days with meaningful traction.

ModelDL 30D7D
MOSS-Music-8B-Instruct-GGUFscragnog385.8K+383
MOSS-Transcribe-Diarize-HFitazap2,573+1,360
acestep-captioner-GGUFdernet694+16
mistralai_Voxtral-Small-24B-2507-GGUFAbu-Dju362+55
Sori-1Bsnkii307+2
A2R-30B-A3BPleasedPenguin134+26