Claw-Eval leaderboard
20 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Ornith-1.0-397B | #1 | DeepReinforce AI | 77.1% |
| MiniMax M3 | #2 | MiniMax | 74.5% |
| Qwen3.6 27B | #3 | Alibaba Cloud | 72.4% |
| Claude Opus 4.6 | #4 | Anthropic | 70.4% |
| Ornith-1.0-35B | #5 | DeepReinforce AI | 69.8% |
| Qwen3.6-35B-A3B | #6 | Alibaba Cloud | 68.7% |
| Claude Sonnet 4.6 | #7 | Anthropic | 67.8% |
| Step 3.7 Flash | #8 | StepFun | 67.1% |
| Qwen3.7-Max | #9 | Alibaba Cloud | 65.2% |
| MiMo-V2.5-Pro | #10 | Xiaomi | 63.8% |
| Muse Spark | #11 | Meta | 63.8% |
| Ornith-1.0-9B | #12 | DeepReinforce AI | 63.1% |
| Qwen3.7-Plus | #13 | Alibaba Cloud | 62.7% |
| GLM-5.1 | #14 | Z.AI | 62.3% |
| Kimi K2.6 | #15 | Moonshot AI | 62.3% |
| MiMo-V2.5 | #16 | Xiaomi | 62.3% |
| GPT-5.4 | #17 | OpenAI | 60.3% |
| DeepSeek V4 Pro | #18 | DeepSeek | 59.8% |
| Claude Opus 4.5 | #19 | Anthropic | 59.6% |
| Qwen3.6 Plus | #20 | Alibaba Cloud | 58.8% |

