JobBench leaderboard
20 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Muse Spark 1.1 | #1 | Meta | 54.7% |
| Kimi K3 | #2 | Moonshot AI | 52.9% |
| Claude Opus 4.7 (Adaptive) | #3 | Anthropic | 45.9% |
| GPT-5.5 | #4 | OpenAI | 42.7% |
| GPT-5.4 | #5 | OpenAI | 38.9% |
| Claude Sonnet 4.6 | #6 | Anthropic | 36.9% |
| Claude Opus 4.6 | #7 | Anthropic | 36.7% |
| GPT-5.2 | #8 | OpenAI | 34.3% |
| GPT-5.3-Codex | #9 | OpenAI | 33.7% |
| Claude Opus 4.5 | #10 | Anthropic | 32.3% |
| Claude Sonnet 4.5 | #11 | Anthropic | 27.7% |
| GPT-5.1-Codex | #12 | OpenAI | 26.2% |
| GPT-5.2 Codex | #13 | OpenAI | 26% |
| Claude 4.1 Opus | #14 | Anthropic | 21.9% |
| Qwen3.5 Plus | #15 | Alibaba Cloud | 18.5% |
| Claude 4 Sonnet | #16 | Anthropic | 18.4% |
| Claude Haiku 4.5 | #17 | Anthropic | 16% |
| Gemini 3 Flash | #18 | 11.4% | |
| Gemini 3 Pro | #19 | 11.4% | |
| Kimi K2.5 | #20 | Moonshot AI | 8.7% |

