Leaderboard bars
20 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Claude Fable 5 | #1 | Anthropic | 51.1% |
| Gemini 3.5 Flash | #2 | 50.1% | |
| GPT-5.5 | #3 | OpenAI | 46.6% |
| Kimi K3 | #4 | Moonshot AI | 45.3% |
| Qwen3.7-Max | #5 | Alibaba Cloud | 45.0% |
| Claude Sonnet 5 | #6 | Anthropic | 44.7% |
| Claude Opus 4.8 | #7 | Anthropic | 44.0% |
| GLM-5.2 | #8 | Z.AI | 42.7% |
| Gemini 3.1 Pro Preview | #9 | 42.2% | |
| Grok 4.5 | #10 | xAI | 40.8% |
| Qwen3.7-Plus | #11 | Alibaba Cloud | 40.6% |
| DeepSeek V4 Pro | #12 | DeepSeek | 40.4% |
| MiMo-V2-Flash | #13 | Xiaomi | 40.4% |
| Kimi K2.7 Code | #14 | Moonshot AI | 40.2% |
| DeepSeek V4 Flash | #15 | DeepSeek | 39.6% |
| Kimi K2.6 | #16 | Moonshot AI | 38.5% |
| GPT-5.4 mini | #17 | OpenAI | 34.6% |
| Mistral Medium 3.5 | #18 | Mistral AI | 33.7% |
| MiniMax M3 | #19 | MiniMax | 32.1% |
| GPT-5.4 nano | #20 | OpenAI | 31.5% |

