SWE-bench Verified (mini-swe-agent-v2) leaderboard
5 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Claude Opus 4.6 | #1 | Anthropic | 75.6% |
| MiniMax M2.7 | #2 | MiniMax | 75.4% |
| GLM-5 | #3 | Z.AI | 72.8% |
| Kimi K2.5 | #4 | Moonshot AI | 70.8% |
| Trinity-Large-Thinking | #5 | Arcee AI | 63.2% |

