Humanity's Last Exam without tools leaderboard
20 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Claude Mythos 5 | #1 | Anthropic | 59% |
| Muse Spark 1.1 | #2 | Meta | 52.2% |
| Sakana Fugu-Ultra | #3 | Sakana AI | 50% |
| Claude Opus 4.8 | #4 | Anthropic | 49.8% |
| Sakana Fugu | #5 | Sakana AI | 47.2% |
| Claude Opus 4.7 (Adaptive) | #6 | Anthropic | 46.9% |
| Gemini 3.1 Pro | #7 | 45.4% | |
| Kimi K3 | #8 | Moonshot AI | 43.5% |
| Claude Sonnet 5 | #9 | Anthropic | 43.2% |
| GPT-5.5 Pro | #10 | OpenAI | 43.1% |
| Muse Spark | #11 | Meta | 42.8% |
| GPT-5.4 Pro | #12 | OpenAI | 42.7% |
| GPT-5.5 | #13 | OpenAI | 41.4% |
| GLM-5.2 | #14 | Z.AI | 40.5% |
| Claude Opus 4.6 | #15 | Anthropic | 40% |
| GPT-5.4 | #16 | OpenAI | 39.8% |
| MiMo-V2.5-Pro | #17 | Xiaomi | 34% |
| Grok 4.20 | #18 | xAI | 31.6% |
| Inkling | #19 | Thinking Machines Lab | 30% |
| GPT-5.4 mini | #20 | OpenAI | 28.2% |

