Massive Multitask Language Understanding Professional leaderboard
20 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Qwen3.7-Max | #1 | Alibaba Cloud | 89.6% |
| Claude Opus 4.5 | #2 | Anthropic | 89.5% |
| Qwen3.6 Plus | #3 | Alibaba Cloud | 88.5% |
| Qwen3.7-Plus | #4 | Alibaba Cloud | 88.5% |
| Qwen3.5 397B | #5 | Alibaba Cloud | 87.8% |
| DeepSeek V4 Pro (Max) | #6 | DeepSeek | 87.5% |
| DeepSeek V4 Pro (High) | #7 | DeepSeek | 87.1% |
| Kimi K2.5 | #8 | Moonshot AI | 87.1% |
| Kimi K2.5 (Reasoning) | #9 | Moonshot AI | 87.1% |
| Nemotron 3 Ultra | #10 | NVIDIA | 86.8% |
| Qwen3.5-122B-A10B | #11 | Alibaba Cloud | 86.7% |
| DeepSeek V4 Flash (High) | #12 | DeepSeek | 86.4% |
| DeepSeek V4 Flash (Max) | #13 | DeepSeek | 86.2% |
| Qwen3.6 27B | #14 | Alibaba Cloud | 86.2% |
| Qwen3.5 27B | #15 | Alibaba Cloud | 86.1% |
| GLM-5 | #16 | Z.AI | 85.7% |
| Qwen3.5-35B-A3B | #17 | Alibaba Cloud | 85.3% |
| Gemma 4 31B | #18 | 85.2% | |
| Qwen3.6-35B-A3B | #19 | Alibaba Cloud | 85.2% |
| MAI-Thinking-1 | #20 | Microsoft | 85% |

