Graduate-Level Google-Proof Q&A leaderboard
20 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Sakana Fugu | #1 | Sakana AI | 95.5% |
| Sakana Fugu-Ultra | #2 | Sakana AI | 95.5% |
| GPT-5.6 Sol | #3 | OpenAI | 94.6% |
| Claude Opus 4.7 (Adaptive) | #4 | Anthropic | 94.2% |
| Claude Mythos 5 | #5 | Anthropic | 94.1% |
| Claude Opus 4.8 | #6 | Anthropic | 93.6% |
| GPT-5.5 | #7 | OpenAI | 93.6% |
| Kimi K3 | #8 | Moonshot AI | 93.5% |
| GPT-5.6 Terra | #9 | OpenAI | 92.9% |
| GPT-5.4 | #10 | OpenAI | 92.8% |
| GPT-5.2 | #11 | OpenAI | 92.4% |
| Qwen3.7-Max | #12 | Alibaba Cloud | 92.4% |
| GPT-5.6 Luna | #13 | OpenAI | 92.3% |
| Gemini 3.5 Flash | #14 | 92.2% | |
| Claude Opus 4.6 | #15 | Anthropic | 91.3% |
| GLM-5.2 | #16 | Z.AI | 91.2% |
| Kimi K2.6 | #17 | Moonshot AI | 90.5% |
| Qwen3.6 Plus | #18 | Alibaba Cloud | 90.4% |
| Qwen3.7-Plus | #19 | Alibaba Cloud | 90.3% |
| DeepSeek V4 Pro (Max) | #20 | DeepSeek | 90.1% |

