ClipTagger-12b

inference-net/ClipTagger-12b

Image Text to Text12.2B parametersLicense: apache-2.0
Tracked by OpenModelStats since September 5, 2026View on Hugging Face ↗
Downloads 30D
60
Total downloads
6,579
Gained 7D
+8(increase)
0.1%(up) vs baseline
Gained 30D
—
Likes
59
+0 in 7D
Rank · tracked models
#54,433
295(down 295 places)this week
Parameters
12.2B
Last source update
Aug 14, 2025
Momentum
20.5
  • ClipTagger-12b gained 8 downloads during the last seven tracked days.
  • It moved from #4945 to #4979 among tracked Image Text to Text models this week.

Downloads over time

Daily gain between consecutive observations

Likes over time

Rank among tracked models

Lower is better

Overview

ClipTagger-12b is a image text to text model published by inference-net. OpenModelStats has tracked the model since Sep 5, 2026, most recently observing it Oct 5, 2026.

Published
Aug 13, 2025
Last updated
Aug 14, 2025
Library
—
License
apache-2.0
Task
Image Text to Text
Parameters
12,189,561,456
Spaces
—
Derivative models
—
Velocity 7D/day
1
safetensorsgemma3VLMvideo-understandingimage-captioninggemmajson-modestructured-outputvideo-analysisimage-text-to-textconversationalen

Similar models

Models similar to ClipTagger-12b
ModelDL 30D
gemma-3-12b-it-FP8-dynamicRedHatAI1,995
gemma-3-12b-itgoogle452.8K
gemma-3-12b-it-int4-awqgaunernst149.2K
gemma-3-12b-ptgoogle32.9K
gemma-3-12b-it-qat-q4_0-unquantizedLightricks20.6K
gemma-3-12b-itunsloth17.2K
inference-net/ClipTagger-12b — Downloads, Growth & Stats | OpenModelStats