Vibe Code Bench v1.1 leaderboard
20 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Claude Opus 4.7 | #1 | Anthropic | 71.0% |
| GPT-5.5 | #2 | OpenAI | 69.8% |
| GPT-5.4 | #3 | OpenAI | 67.4% |
| GPT-5.3-Codex | #4 | OpenAI | 61.8% |
| Claude Opus 4.6 | #5 | Anthropic | 57.6% |
| GPT-5.2 | #6 | OpenAI | 53.5% |
| Claude Opus 4.6 (Adaptive) | #7 | Anthropic | 53.5% |
| Claude Sonnet 4.6 | #8 | Anthropic | 51.5% |
| DeepSeek V4 Pro (Max) | #9 | DeepSeek | 49.9% |
| Gemini 3.5 Flash | #10 | 48.7% | |
| GPT-5.4 mini | #11 | OpenAI | 48.0% |
| GPT-5.2 Codex | #12 | OpenAI | 37.9% |
| Kimi K2.6 | #13 | Moonshot AI | 37.9% |
| Gemini 3.1 Pro | #14 | 32.0% | |
| GLM-5.1 | #15 | Z.AI | 31.5% |
| MiniMax M2.7 | #16 | MiniMax | 27.0% |
| GPT-5.4 nano | #17 | OpenAI | 26.1% |
| Qwen3.6 Plus | #18 | Alibaba Cloud | 25.6% |
| GPT-5.1 | #19 | OpenAI | 24.6% |
| GLM-5 (Reasoning) | #20 | Z.AI | 23.4% |

