ModelsCompareBest forBenchmarksStatusPricingAPI

What is FrontierMath?

Original, unpublished mathematics problems created and verified by expert mathematicians: 295 base problems (Tiers 1-3) plus 43 exceptionally hard Tier 4 problems. Answers are checked automatically, and Epoch AI evaluates models on the private set.

FrontierMath scores by model

1
GPT-6 AstraOpenAI93.7%
2
Claude Fable 5.1Anthropic90.2%
3
GPT-5.6 SolOpenAI89.1%
4
GPT-5.5 ProOpenAI87.7%
5
6
Claude Opus 5Anthropic85.6%
7
GPT-5.5OpenAI85.3%
8
GPT-5.4 ProOpenAI82.5%
9
GPT-5.6 LunaOpenAI82.1%
10
Claude Opus 4.8Anthropic80%
11
GPT-5.4OpenAI78.6%
12
Qwen3.8-MaxQwen74.7%
13
GPT-5.2 ProOpenAI74%
14
Kimi K3Moonshot AI72.2%
15
16
Claude Opus 4.7Anthropic70.2%
17
GLM-5.3Z.ai68.8%
18
19
GPT-5.2OpenAI67.4%
20
21
Claude Opus 4.6Anthropic66%
22
Claude Sonnet 5Anthropic65.6%
23
25
GLM-5.2Z.ai59.2%
26
27
Grok 4.5xAI57.2%
28
Kimi K2.6Moonshot AI57.2%
29
GPT-5 ProOpenAI55.8%
30
31
GPT-5OpenAI55.4%
32
Kimi K2.7 CodeMoonshot AI54%
33
GPT-5.4 miniOpenAI51.2%
35
GPT-5 miniOpenAI46.7%
36
DeepSeek V4 ProDeepSeek45.3%
37
GPT-5.4 nanoOpenAI44.9%
39
Grok 4.3xAI42.8%
40
Qwen3.6-PlusQwen38.2%