Measuring Short-Form Factuality in Large Language Models leaderboard
9 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| DeepSeek V4 Pro (Max) | #1 | DeepSeek | 57.9% |
| DeepSeek V4 Pro Base | #2 | DeepSeek | 55.2% |
| DeepSeek V4 Pro (High) | #3 | DeepSeek | 46.2% |
| DeepSeek V4 Pro | #4 | DeepSeek | 45% |
| DeepSeek V4 Flash (Max) | #5 | DeepSeek | 34.1% |
| MAI-Thinking-1 | #6 | Microsoft | 31% |
| DeepSeek V4 Flash Base | #7 | DeepSeek | 30.1% |
| DeepSeek V4 Flash (High) | #8 | DeepSeek | 28.9% |
| DeepSeek V4 Flash | #9 | DeepSeek | 23.1% |

