GDPval-AA normalized leaderboard
20 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Claude Fable 5 | #1 | Anthropic | 62.4% |
| GPT-5.6 Sol | #2 | OpenAI | 61.8% |
| Kimi K3 | #3 | Moonshot AI | 59% |
| Claude Sonnet 5 | #4 | Anthropic | 55.4% |
| Claude Opus 4.8 | #5 | Anthropic | 54.7% |
| GPT-5.6 Luna | #6 | OpenAI | 54.2% |
| GPT-5.6 Terra | #7 | OpenAI | 54.1% |
| Grok 4.5 | #8 | xAI | 51.7% |
| GLM-5.2 | #9 | Z.AI | 50.7% |
| Claude Opus 4.7 (Adaptive) | #10 | Anthropic | 49.8% |
| GPT-5.5 | #11 | OpenAI | 49.5% |
| Gemini 3.6 Flash | #12 | 46.1% | |
| GPT-5.4 | #13 | OpenAI | 44.7% |
| MiniMax M3 | #14 | MiniMax | 44.7% |
| Muse Spark 1.1 | #15 | Meta | 43.7% |
| Gemini 3.5 Flash | #16 | 42.4% | |
| DeepSeek V4 Pro (Max) | #17 | DeepSeek | 40.4% |
| DeepSeek V4 Pro (High) | #18 | DeepSeek | 39.9% |
| Qwen3.7-Max | #19 | Alibaba Cloud | 38.7% |
| MiMo-V2.5-Pro | #20 | Xiaomi | 38.3% |

