rlmath-agentic-grpo-checkpoints

amphora/rlmath-agentic-grpo-checkpoints

Reinforcement LearningLicense: apache-2.0
Tracked by OpenModelStats since October 2, 2026View on Hugging Face ↗
Downloads 30D
0
Total downloads
0
Gained 7D
—
Gained 30D
—
Likes
0
Rank · tracked models
—
–this week
Parameters
—
Last source update
Oct 8, 2026

Downloads over time

Rolling recent-window downloads as reported

Likes over time

Rank among tracked models

Lower is better

Not enough tracked history yet for a chart.

OpenModelStats began tracking this model on 2026-10-02. Charts appear as daily observations accumulate.

Overview

rlmath-agentic-grpo-checkpoints is a reinforcement learning model published by amphora. OpenModelStats has tracked the model since Oct 2, 2026, most recently observing it 6 min ago.

Published
Oct 2, 2026
Last updated
Oct 8, 2026
Library
—
License
apache-2.0
Task
Reinforcement Learning
Parameters
—
Spaces
—
Derivative models
—
Velocity 7D/day
—
safetensorsreinforcement-learninggrpoagenticmathverlharborbase_model:Qwen/Qwen3-30B-A3B-Thinking-2507base_model:finetune:Qwen/Qwen3-30B-A3B-Thinking-2507license:apache-2.0region:us

Publisher

amphoraView publisher statistics →

Derived from Qwen/Qwen3-30B-A3B-Thinking-2507 (reported by the source; parent not yet tracked).

Similar models

Models similar to rlmath-agentic-grpo-checkpoints
ModelDL 30D
ppo-seals-CartPole-v0HumanCompatibleAI171.7K
ppo-Pendulum-v1HumanCompatibleAI46.1K
Tifa-Deepsex-14b-CoT-GGUFmradermacher20.9K
NoveltyAdapt-policieshelenlu9420.7K
sac-BipedalWalkerHardcore-v3sb38,772
Qwen3-14B-ARPO-DeepSearch-i1-GGUFmradermacher7,028