MLE-Bench leaderboard
6 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Claude Sonnet 5 | #1 | Anthropic | 66.9% |
| Gemini 3.6 Flash | #2 | 63.9% | |
| Gemini 3.5 Flash | #3 | 49.7% | |
| GPT-5.6 Luna | #4 | OpenAI | 47.6% |
| Grok 4.5 | #5 | xAI | 43.2% |
| Gemini 3.1 Pro Preview | #6 | 42.6% |

