Reinforcement Learning Models
Reinforcement learning models and agents, including trained policy models.
- Top-10 combined DL 30D
- 340.4K
- Tasks directory position
- See all tasks
- Growth history
- Accumulating
- Last refresh
- Aug 24, 2026
Trending now
| # | Model | Task | DL 30D | 7D | Likes | Params |
|---|---|---|---|---|---|---|
| 1 | MrPongfromziro | Reinforcement Learning | 200 | — | ||
| 2 | SymphonyGenSymphonyGen | Reinforcement Learning | 0 | — | ||
| 3 | MrBalancefromziro | Reinforcement Learning | 103 | — | ||
| 4 | Tifa-DeepsexV2-7b-MGRPO-GGUF-Q4ValueFX9507 | Reinforcement Learning | 1,053 | — | ||
| 5 | 2026.RA.Fairness-GRPO-v2-Adapterssiddharthmb | Reinforcement Learning | 0 | — | ||
| 6 | diamondeloialonso | Reinforcement Learning | 0 | — | ||
| 7 | chessmambaTobiasLogic | Reinforcement Learning | 32 | — | ||
| 8 | VisualQuality-R1-7BTianheWu | Reinforcement Learning | 6,258 | — | ||
| 9 | ppo-LunarLander-v3-flipKaptainKris | Reinforcement Learning | 144.3K | — | ||
| 10 | ppo-LunarLander-v3SepehrB1 | Reinforcement Learning | 13 | — |
Most downloaded
| Model | Task | DL 30D | 7D | Likes | Params |
|---|---|---|---|---|---|
| ppo-LunarLander-v3-flipKaptainKris | Reinforcement Learning | 144.3K | — | ||
| joint-space-empowermentjamesheald | Reinforcement Learning | 95.1K | — | ||
| ppo-seals-CartPole-v0HumanCompatibleAI | Reinforcement Learning | 47.5K | — | ||
| ppo-Pendulum-v1HumanCompatibleAI | Reinforcement Learning | 19.1K | — | ||
| VisualQuality-R1-7BTianheWu | Reinforcement Learning | 6,258 | — | ||
| KernelBench-RLVR-120b-i1-GGUFmradermacher | Reinforcement Learning | 6,122 | — | ||
| beaver-7b-v1.0-costPKU-Alignment | Reinforcement Learning | 6,092 | — | ||
| Tifa-Deepsex-14b-CoT-Q8yhyk1971 | Reinforcement Learning | 6,061 | — | ||
| beaver-7b-v1.0-rewardPKU-Alignment | Reinforcement Learning | 5,066 | — | ||
| ppo-HuggyPaulVialard | Reinforcement Learning | 4,921 | — |
New & notable
Published within the last 90 days with meaningful traction.
| Model | Task | DL 30D | 7D gained | Likes | Params | Published |
|---|---|---|---|---|---|---|
| ppo-LunarLander-v3-flipKaptainKris | Reinforcement Learning | 144.3K | — | Jul 14, 2026 | ||
| joint-space-empowermentjamesheald | Reinforcement Learning | 95.1K | — | Aug 5, 2026 | ||
| KernelBench-RLVR-120b-i1-GGUFmradermacher | Reinforcement Learning | 6,122 | — | Aug 15, 2026 | ||
| OPOD-Qwen3-Omni-30B-A3B-i1-GGUFmradermacher | Reinforcement Learning | 1,905 | — | Aug 7, 2026 | ||
| CMI-MEM-4B-i1-GGUFmradermacher | Reinforcement Learning | 1,772 | — | Aug 3, 2026 | ||
| SkillGate-9B-i1-GGUFmradermacher | Reinforcement Learning | 1,701 | — | Aug 15, 2026 | ||
| InSight-doc-8B-i1-GGUFmradermacher | Reinforcement Learning | 1,698 | — | Aug 13, 2026 | ||
| h-cgqe-gic2026Ryukijano | Reinforcement Learning | 1,474 | — | Jul 16, 2026 | ||
| mythos_fastShadow0482 | Reinforcement Learning | 1,285 | — | Jun 18, 2026 | ||
| AgentMercury-Qwen3.5-4B-i1-GGUFmradermacher | Reinforcement Learning | 1,220 | — | Aug 15, 2026 |