Gert Labs Composite Game Benchmark leaderboard
20 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Claude Opus 4.8 | #1 | Anthropic | 73.0% |
| GPT-5.5 | #2 | OpenAI | 72.9% |
| Claude Opus 4.7 | #3 | Anthropic | 65.6% |
| GPT-5.4 | #4 | OpenAI | 64.9% |
| Qwen3.7-Max | #5 | Alibaba Cloud | 64.3% |
| Claude Opus 4.5 | #6 | Anthropic | 64.2% |
| Gemini 3 Pro | #7 | 63.2% | |
| Claude Sonnet 4.6 | #8 | Anthropic | 62.9% |
| MiMo-V2.5-Pro | #9 | Xiaomi | 62.7% |
| Claude Opus 4.6 | #10 | Anthropic | 61.9% |
| Gemini 3.5 Flash | #11 | 61.9% | |
| GLM-5.1 | #12 | Z.AI | 60.1% |
| GPT-5.3-Codex | #13 | OpenAI | 57.5% |
| Gemini 3.1 Pro | #14 | 56.9% | |
| Kimi K2.6 | #15 | Moonshot AI | 56.8% |
| Gemini 3 Flash | #16 | 56.6% | |
| Qwen3.6 27B | #17 | Alibaba Cloud | 54.8% |
| DeepSeek V4 Flash | #18 | DeepSeek | 54.4% |
| GPT-5.2 Codex | #19 | OpenAI | 51.8% |
| Step 3.7 Flash | #20 | StepFun | 51.6% |

