SWE-bench Multilingual leaderboard
20 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Claude Mythos 5 | #1 | Anthropic | 92.2% |
| Claude Opus 4.8 | #2 | Anthropic | 84.4% |
| Composer 2.5 | #3 | Cursor | 79.8% |
| Ornith-1.0-397B | #4 | DeepReinforce AI | 78.9% |
| Laguna S 2.1 | #5 | Poolside | 78.5% |
| Claude Sonnet 5 | #6 | Anthropic | 78.3% |
| Qwen3.7-Max | #7 | Alibaba Cloud | 78.3% |
| Grok 4.5 | #8 | xAI | 78% |
| SWE-1.7 | #9 | Cognition | 77.8% |
| Claude Opus 4.5 | #10 | Anthropic | 77.5% |
| Kimi K2.6 | #11 | Moonshot AI | 76.7% |
| MiniMax M2.7 | #12 | MiniMax | 76.5% |
| DeepSeek V4 Pro (Max) | #13 | DeepSeek | 76.2% |
| Qwen3.7-Plus | #14 | Alibaba Cloud | 75.8% |
| DeepSeek V4 Pro (High) | #15 | DeepSeek | 74.1% |
| Qwen3.6 Plus | #16 | Alibaba Cloud | 73.8% |
| Composer 2 | #17 | Cursor | 73.7% |
| DeepSeek V4 Flash (Max) | #18 | DeepSeek | 73.3% |
| GLM-5 | #19 | Z.AI | 73.3% |
| Kimi K2.5 | #20 | Moonshot AI | 73% |

