Reinforcement Learning Models
Reinforcement learning models and agents, including trained policy models.
- Top-10 combined DL 30D
- 286.5K
- Tasks directory position
- See all tasks
- Growth history
- Available
- Last refresh
- Sep 22, 2026
Trending now
| # | Model | Task | DL 30D | 7D | Likes | Params |
|---|---|---|---|---|---|---|
| 1 | sales-conversion-model-reinf-learningDeepMostInnovations | Reinforcement Learning | 600 | 36.9%(up) | ||
| 2 | stock-trading-rl-agentAdilbai | Reinforcement Learning | 227 | 0.1%(up) | ||
| 3 | proximal_policy_optimization_lunar_lander_v2imflash217 | Reinforcement Learning | 2 | — | ||
| 4 | med-advisor-conversation-4B-i1-GGUFmradermacher | Reinforcement Learning | 1,925 | — | ||
| 5 | ReinforcementLearningdilnaz-suleimenova | Reinforcement Learning | 18 | — | ||
| 6 | NitroGennvidia | Reinforcement Learning | 0 | — | ||
| 7 | Reinforcement-LearningyDiffraction | Reinforcement Learning | 1 | — | ||
| 8 | Qwen3-8B-MiMo-Music-GRPOPrompt48 | Reinforcement Learning | 48 | — | ||
| 9 | AQARION-DEFECTQuantarion9 | Reinforcement Learning | 0 | — | ||
| 10 | Reinforcement-Learning-for-Gold-Trading-ModelJonusNattapong | Reinforcement Learning | 106 | — |
Most downloaded
| Model | Task | DL 30D | 7D | Likes | Params |
|---|---|---|---|---|---|
| ppo-seals-CartPole-v0HumanCompatibleAI | Reinforcement Learning | 166.3K | 1.4%(up) | ||
| ppo-Pendulum-v1HumanCompatibleAI | Reinforcement Learning | 44.8K | 1.0%(up) | ||
| Tifa-Deepsex-14b-CoT-GGUFmradermacher | Reinforcement Learning | 20.8K | 20.0%(up) | ||
| NoveltyAdapt-policieshelenlu94 | Reinforcement Learning | 20.7K | — | ||
| sac-BipedalWalkerHardcore-v3sb3 | Reinforcement Learning | 8,772 | — | ||
| decision-transformer-gym-hopper-mediumedbeeching | Reinforcement Learning | 6,489 | 0.6%(up) | ||
| Aztec-Coder-4B-i1-GGUFmradermacher | Reinforcement Learning | 5,282 | — | ||
| VisualQuality-R1-7BTianheWu | Reinforcement Learning | 5,044 | 1.0%(up) | ||
| OpenThinker3-7B-SFT-GRPO-DEDGurgurov | Reinforcement Learning | 4,210 | 44.3%(up) | ||
| Tifa-DeepsexV3-14b-GGUF-Q6ValueFX9507 | Reinforcement Learning | 4,069 | 0% |
Fastest growing
Downloads gained over the last seven tracked days.
| Model | Task | DL 30D | 7D7D gained | Likes | Params |
|---|---|---|---|---|---|
| ppo-seals-CartPole-v0HumanCompatibleAI | Reinforcement Learning | 166.3K | +24.4K | ||
| Tifa-Deepsex-14b-CoT-GGUFmradermacher | Reinforcement Learning | 20.8K | +17.4K | ||
| ppo-Pendulum-v1HumanCompatibleAI | Reinforcement Learning | 44.8K | +6,656 | ||
| OPD-Aha-9B-i1-GGUFmradermacher | Reinforcement Learning | 2,999 | +2,614 | ||
| OPD-Aha-4B-i1-GGUFmradermacher | Reinforcement Learning | 2,856 | +2,451 | ||
| OpenThinker3-7B-SFT-GRPO-DEDGurgurov | Reinforcement Learning | 4,210 | +1,987 | ||
| newtnicklashansen | Reinforcement Learning | 2,249 | +1,892 | ||
| VisualQuality-R1-7BTianheWu | Reinforcement Learning | 5,044 | +1,747 | ||
| Tifa-DeepsexV2-7b-MGRPO-GGUF-Q4ValueFX9507 | Reinforcement Learning | 2,677 | +1,571 | ||
| ScreenHighlighterRL-2B-i1-GGUFmradermacher | Reinforcement Learning | 2,003 | +1,570 |
New & notable
Published within the last 90 days with meaningful traction.
| Model | Task | DL 30D | 7D7D gained | Likes | Params | Published |
|---|---|---|---|---|---|---|
| NoveltyAdapt-policieshelenlu94 | Reinforcement Learning | 20.7K | — | Sep 23, 2026 | ||
| Aztec-Coder-4B-i1-GGUFmradermacher | Reinforcement Learning | 5,282 | — | Sep 27, 2026 | ||
| OpenThinker3-7B-SFT-GRPO-DEDGurgurov | Reinforcement Learning | 4,210 | +1,987 | Aug 21, 2026 | ||
| OPD-Aha-9B-i1-GGUFmradermacher | Reinforcement Learning | 2,999 | +2,614 | Sep 15, 2026 | ||
| OphVLM-R1QiZishi | Reinforcement Learning | 2,984 | — | Jul 11, 2026 | ||
| CNY-7B-i1-GGUFmradermacher | Reinforcement Learning | 2,883 | +269 | Sep 1, 2026 | ||
| OPD-Aha-4B-i1-GGUFmradermacher | Reinforcement Learning | 2,856 | +2,451 | Sep 15, 2026 | ||
| EventMemAgent-8B-i1-GGUFmradermacher | Reinforcement Learning | 2,838 | +243 | Sep 9, 2026 | ||
| Kronumos-Kairos-v2-i1-GGUFmradermacher | Reinforcement Learning | 2,811 | — | Oct 3, 2026 | ||
| Evidence-RL-9B-i1-GGUFmradermacher | Reinforcement Learning | 2,800 | — | Sep 27, 2026 |