ResearchClawBench leaderboard
20 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Claude Opus 4.8 | #1 | Anthropic | 21.1% |
| Claude Opus 4.7 | #2 | Anthropic | 20.7% |
| GLM-5.2 | #3 | Z.AI | 20.7% |
| Claude Opus 4.6 | #4 | Anthropic | 19.9% |
| MiniMax M3 | #5 | MiniMax | 19.8% |
| Qwen3.7-Max | #6 | Alibaba Cloud | 18.7% |
| GLM-5.1 | #7 | Z.AI | 18.2% |
| Gemini 3.5 Flash | #8 | 18% | |
| Kimi K2.6 | #9 | Moonshot AI | 18% |
| Qwen3.6 Plus | #10 | Alibaba Cloud | 18% |
| DeepSeek V4 Pro | #11 | DeepSeek | 17.1% |
| GPT-5.5 | #12 | OpenAI | 17% |
| MiMo-V2.5 | #13 | Xiaomi | 16.9% |
| GPT-5.4 | #14 | OpenAI | 15.3% |
| MiMo-V2-Pro | #15 | Xiaomi | 15.3% |
| Qwen3.5 397B | #16 | Alibaba Cloud | 14.2% |
| Kimi K2.5 | #17 | Moonshot AI | 14% |
| Grok 4.1 | #18 | xAI | 13.5% |
| Gemini 3.1 Pro | #19 | 13.3% | |
| Grok 4.3 | #20 | xAI | 12.4% |

