MedXpertQA Multimodal leaderboard
7 ranked models · higher is better
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Gemini 3.1 Pro | #1 | 81.3% | |
| Muse Spark | #2 | Meta | 78.4% |
| GPT-5.4 | #3 | OpenAI | 77.1% |
| Qwen3.7-Plus | #4 | Alibaba Cloud | 71% |
| Grok 4.20 | #5 | xAI | 65.8% |
| Claude Opus 4.6 | #6 | Anthropic | 64.8% |
| Gemma 4 12B | #7 | 48.7% |

