Scientific Code Benchmark leaderboard
13 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Sakana Fugu | #1 | Sakana AI | 60.1% |
| Sakana Fugu-Ultra | #2 | Sakana AI | 58.7% |
| Qwen3.7-Max | #3 | Alibaba Cloud | 53.5% |
| Gemini 3.5 Flash | #4 | 53.1% | |
| Kimi K2.6 | #5 | Moonshot AI | 52.2% |
| Qwen3.7-Plus | #6 | Alibaba Cloud | 51.3% |
| Kimi K2.5 | #7 | Moonshot AI | 48.7% |
| Grok 4.3 | #8 | xAI | 47.3% |
| Qwen 3.6 Max (preview) | #9 | Alibaba Cloud | 47% |
| Nemotron 3 Ultra | #10 | NVIDIA | 44.6% |
| Hy3 Preview | #11 | Tencent | 41.2% |
| Nemotron 3 Nano Omni 30B A3B | #12 | NVIDIA | 32% |
| Ling 2.6 Flash | #13 | InclusionAI | 27% |

