Massive Multitask Language Understanding leaderboard
8 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| o1 | #1 | OpenAI | 91.8% |
| GPT-4.1 | #2 | OpenAI | 90.2% |
| DeepSeek V4 Pro Base | #3 | DeepSeek | 90.1% |
| DeepSeek V4 Flash Base | #4 | DeepSeek | 88.7% |
| GPT-4.1 mini | #5 | OpenAI | 87.5% |
| Trinity-Large-Preview | #6 | Arcee AI | 87.2% |
| o3-mini | #7 | OpenAI | 86.9% |
| GPT-4.1 nano | #8 | OpenAI | 80.1% |

