SuperGPQA: Scaling LLM Evaluation Across 285 Graduate Disciplines leaderboard
19 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Claude Opus 4.6 | #1 | Anthropic | 95% |
| Claude Sonnet 4.6 | #2 | Anthropic | 95% |
| Qwen 3.6 Max (preview) | #3 | Alibaba Cloud | 73.9% |
| Qwen3.7-Max | #4 | Alibaba Cloud | 73.6% |
| Qwen3.6 Plus | #5 | Alibaba Cloud | 71.6% |
| Qwen3.7-Plus | #6 | Alibaba Cloud | 71.4% |
| Claude Opus 4.5 | #7 | Anthropic | 70.6% |
| Qwen3.5 397B | #8 | Alibaba Cloud | 70.4% |
| Kimi K2.5 | #9 | Moonshot AI | 69.2% |
| Qwen3.5-122B-A10B | #10 | Alibaba Cloud | 67.1% |
| GLM-5 | #11 | Z.AI | 66.8% |
| Qwen3.6 27B | #12 | Alibaba Cloud | 66% |
| Qwen3.5 27B | #13 | Alibaba Cloud | 65.6% |
| Qwen3.6-35B-A3B | #14 | Alibaba Cloud | 64.7% |
| Qwen3.5-35B-A3B | #15 | Alibaba Cloud | 63.4% |
| Qwen3 235B 2507 | #16 | Alibaba Cloud | 62.6% |
| DeepSeek V4 Pro Base | #17 | DeepSeek | 53.9% |
| DeepSeek V4 Flash Base | #18 | DeepSeek | 46.5% |
| MiniCPM5-1B | #19 | OpenBMB | 23.1% |

