Leaderboard bars
17 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| GPT-5.5 | #1 | OpenAI | 80.7% |
| GPT-5.4 | #2 | OpenAI | 80.3% |
| Gemini 3.1 Pro Preview | #3 | 79.9% | |
| Claude Fable 5 | #4 | Anthropic | 78.3% |
| Claude Opus 4.8 | #5 | Anthropic | 77.2% |
| Claude Opus 4.7 | #6 | Anthropic | 76.9% |
| Claude Opus 4.6 | #7 | Anthropic | 76.3% |
| Claude Opus 4.5 | #8 | Anthropic | 76.0% |
| Claude Sonnet 4.6 | #9 | Anthropic | 75.5% |
| Gemini 3.5 Flash | #10 | 75.0% | |
| Qwen3.7-Max | #11 | Alibaba Cloud | 74.3% |
| GPT-5.3-Codex | #12 | OpenAI | 72.8% |
| Qwen3.6 Plus | #13 | Alibaba Cloud | 70.8% |
| GLM-5.1 | #14 | Z.AI | 70.2% |
| GPT-5.4 nano | #15 | OpenAI | 70.1% |
| MiniMax M3 | #16 | MiniMax | 70.0% |
| Kimi K2.5 | #17 | Moonshot AI | 69.1% |

