OpenThinker3-7B-SFT-GRPO-DE

DGurgurov/OpenThinker3-7B-SFT-GRPO-DE

Reinforcement Learning952M parameters
Tracked by OpenModelStats since September 3, 2026View on Hugging Face ↗
Downloads 30D
5,803
Total downloads
7,068
Gained 7D
+1,987(increase)
44.3%(up) vs baseline
Gained 30D
—
Likes
0
+0 in 7D
Rank · tracked models
#10,831
184(down 184 places)this week
Parameters
952M
Last source update
Aug 21, 2026
Momentum
68.0
  • OpenThinker3-7B-SFT-GRPO-DE gained 1,987 downloads during the last seven tracked days.
  • It moved from #8 to #7 among tracked Reinforcement Learning models this week.

Downloads over time

Rolling recent-window downloads as reported

Likes over time

Rank among tracked models

Lower is better

Overview

OpenThinker3-7B-SFT-GRPO-DE is a reinforcement learning model published by DGurgurov. OpenModelStats has tracked the model since Sep 3, 2026, most recently observing it Oct 2, 2026.

Published
Aug 21, 2026
Last updated
Aug 21, 2026
Library
—
License
—
Task
Reinforcement Learning
Parameters
951,952,064
Spaces
—
Derivative models
—
Velocity 7D/day
284
safetensorsqwen2reasoningmultilingualdereasonxlreinforcement-learninggrpodataset:toroe/ReasonXL-SFTarxiv:2604.12378base_model:open-thoughts/OpenThinker-7Bbase_model:finetune:open-thoughts/OpenThinker-7B

Publisher

DGurgurovView publisher statistics →

Derived from open-thoughts/OpenThinker-7B (reported by the source; parent not yet tracked).

Similar models

Models similar to OpenThinker3-7B-SFT-GRPO-DE
ModelDL 30D
OphVLM-R1QiZishi2,953
Qwen3-4B-Instruct-2507.prestar-RL.reason-only.lr7e-7-kl0.step-2176JackHsieh334
VFIG-4BXunmeiLiu300
jatjat-project176
beaver-7b-v1.0-costPKU-Alignment3,638
beaver-7b-v1.0-rewardPKU-Alignment3,009
DGurgurov/OpenThinker3-7B-SFT-GRPO-DE — Downloads, Growth & Stats | OpenModelStats