12,500 competition mathematics problems (5,000 test) from AMC, AIME, and other sources covering algebra, geometry, number theory, and more. Harder than GSM8K. Modern evaluations typically use the MATH-500 representative subset.
Accuracy is the reported evaluation metric for MATH. Codesota tracks published model scores on this metric so readers can compare state-of-the-art results across sources and model families.
Higher is better
Muted rows were not state of the art when published — an earlier or same-year result already scored better.
| Rank | Model | Trust | Score | Year | Links | Fix |
|---|---|---|---|---|---|---|
| 01 | o4-mini (high) | unverified | 98.2 | 2026 | N/A | Looks wrong? |
| 02 | o3 (high) | unverified | 98.1 | 2026 | N/A | Looks wrong? |
| 03 | o3-mini | unverified | 97.9 | 2026 | N/A | Looks wrong? |
| 04 | o3 | unverified | 97.8 | 2026 | N/A | Looks wrong? |
| 05 | o4-mini | unverified | 97.5 | 2026 | N/A | Looks wrong? |
| 06 | DeepSeek-R1 | unverified | 97.3 | 2026 | N/A | Looks wrong? |
| 07 | Gemini 2.5 Pro | unverified | 97.3 | 2026 | N/A | Looks wrong? |
| 08 | o1 | unverified | 96.4 | 2026 | N/A | Looks wrong? |
| 09 | Claude 3.7 Sonnet | unverified | 96.2 | 2026 | N/A | Looks wrong? |
| 10 | Kimi k1.5 | unverified | 96.2 | 2026 | N/A | Looks wrong? |
| 11 | DeepSeek-R1-Zero | unverified | 95.9 | 2026 | N/A | Looks wrong? |
| 12 | DeepSeek-R1-Distill-Llama-70B | unverified | 94.5 | 2026 | N/A | Looks wrong? |
| 13 | DeepSeek-R1-Distill-Qwen-32B | unverified | 94.3 | 2026 | N/A | Looks wrong? |
| 14 | DeepSeek-V3-0324 | unverified | 94 | 2026 | N/A | Looks wrong? |
| 15 | QwQ-32B | unverified | 90.6 | 2026 | N/A | Looks wrong? |
| 16 | deepseek-v3 | unverified | 90.2 | 2026 | N/A | Looks wrong? |
| 17 | o1-mini | unverified | 90 | 2026 | N/A | Looks wrong? |
| 18 | GPT-4.5 Preview | unverified | 87.1 | 2026 | N/A | Looks wrong? |
| 19 | o1-preview | unverified | 85.5 | 2026 | N/A | Looks wrong? |
| 20 | GPT-4.1 | unverified | 82.1 | 2026 | N/A | Looks wrong? |
| 21 | gpt-4o | unverified | 76.6 | 2026 | N/A | Looks wrong? |
| 22 | Grok 2 | unverified | 76.1 | 2026 | N/A | Looks wrong? |
| 23 | Llama 3.1 405B | unverified | 73.8 | 2026 | N/A | Looks wrong? |
| 24 | GPT-4 Turbo | unverified | 73.4 | 2026 | N/A | Looks wrong? |
| 25 | claude-35-sonnet | unverified | 71.1 | 2026 | N/A | Looks wrong? |
| 26 | gpt-4o-mini | unverified | 70.2 | 2026 | N/A | Looks wrong? |
| 27 | Llama 3.1 70B | unverified | 68 | 2026 | N/A | Looks wrong? |
| 28 | gemini-15-pro | unverified | 67.7 | 2026 | N/A | Looks wrong? |
| 29 | Claude 3 Opus | unverified | 60.1 | 2026 | N/A | Looks wrong? |