vit-gpt2-image-captioning

Xenova/vit-gpt2-image-captioning

Image to Texttransformers.js
Tracked by OpenModelStats since August 24, 2026View on Hugging Face ↗
Downloads 30D
7,940
Total downloads
88.1K
Gained 7D
Gained 30D
Likes
29
Rank · tracked models
#8,945
this week
Parameters
Last source update
Oct 8, 2024

Downloads over time

Daily gain between consecutive observations

Not enough tracked history yet for a chart.

OpenModelStats began tracking this model on 2026-08-24. Charts appear as daily observations accumulate.

Likes over time

Not enough tracked history yet for a chart.

OpenModelStats began tracking this model on 2026-08-24. Charts appear as daily observations accumulate.

Rank among tracked models

Lower is better

Not enough tracked history yet for a chart.

OpenModelStats began tracking this model on 2026-08-24. Charts appear as daily observations accumulate.

Overview

vit-gpt2-image-captioning is a image to text model published by Xenova. OpenModelStats has tracked the model since Aug 24, 2026, most recently observing it 5 min ago.

Published
May 2, 2023
Last updated
Oct 8, 2024
Library
transformers.js
License
Task
Image to Text
Parameters
Spaces
Derivative models
Velocity 7D/day
transformers.jsonnxvision-encoder-decoderimage-text-to-textimage-captioningimage-to-textbase_model:nlpconnect/vit-gpt2-image-captioningbase_model:quantized:nlpconnect/vit-gpt2-image-captioningregion:us

Publisher

XenovaView publisher statistics →

Derived from nlpconnect/vit-gpt2-image-captioning (reported by the source; parent not yet tracked).

Similar models

Models similar to vit-gpt2-image-captioning
ModelDL 30D
blip-image-captioning-baseSalesforce2.1M
PP-OCRv5_server_detPaddlePaddle768.2K
manga-ocr-basekha-white659.4K
en_PP-OCRv5_mobile_recPaddlePaddle524.9K
trocr-small-handwrittenmicrosoft489.2K
blip-image-captioning-largeSalesforce484.2K