Instruction-Following Eval leaderboard
20 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Qwen3.5 27B | #1 | Alibaba Cloud | 95% |
| Agents-A1 | #2 | InternScience | 94.8% |
| Qwen3.7-Plus | #3 | Alibaba Cloud | 94.6% |
| Qwen3.6 Plus | #4 | Alibaba Cloud | 94.3% |
| Qwen3.7-Max | #5 | Alibaba Cloud | 94.3% |
| Kimi K2.5 | #6 | Moonshot AI | 93.9% |
| o3-mini | #7 | OpenAI | 93.9% |
| Qwen3.5-122B-A10B | #8 | Alibaba Cloud | 93.4% |
| GLM-5 | #9 | Z.AI | 92.6% |
| Qwen3.5 397B | #10 | Alibaba Cloud | 92.6% |
| o1 | #11 | OpenAI | 92.2% |
| Qwen3.5-35B-A3B | #12 | Alibaba Cloud | 91.9% |
| LFM2.5-8B-A1B | #13 | LiquidAI | 91.8% |
| Claude Opus 4.5 | #14 | Anthropic | 90.9% |
| GPT-4.1 mini | #15 | OpenAI | 88.5% |
| GPT-4.1 | #16 | OpenAI | 87.4% |
| DeepSeek V3 | #17 | DeepSeek | 86.1% |
| ZAYA1-8B | #18 | Zyphra | 85.6% |
| GPT-4.1 nano | #19 | OpenAI | 83.2% |
| MiniCPM5-1B | #20 | OpenBMB | 80.4% |

