What is FrontierMath?
Original, unpublished mathematics problems created and verified by expert mathematicians: 295 base problems (Tiers 1-3) plus 43 exceptionally hard Tier 4 problems. Answers are checked automatically, and Epoch AI evaluates models on the private set.
FrontierMath scores by model
1
GPT-6 AstraOpenAI93.7% ↗
2
Claude Fable 5.1Anthropic90.2% ↗
3
GPT-5.6 SolOpenAI89.1% ↗
4
GPT-5.5 ProOpenAI87.7% ↗
5
GPT-5.6 TerraOpenAI86% ↗
6
Claude Opus 5Anthropic85.6% ↗
8
GPT-5.4 ProOpenAI82.5% ↗
9
GPT-5.6 LunaOpenAI82.1% ↗
10
Claude Opus 4.8Anthropic80% ↗
12
Qwen3.8-MaxQwen74.7% ↗
13
GPT-5.2 ProOpenAI74% ↗
15
Gemini 3.7 FlashGoogle71.6% ↗
16
Claude Opus 4.7Anthropic70.2% ↗
18
Gemini 3.8 FlashGoogle68.4% ↗
21
Claude Opus 4.6Anthropic66% ↗
22
Claude Sonnet 5Anthropic65.6% ↗
23
Gemini 3.5 FlashGoogle62.8% ↗
24
Gemini 3.1 Pro PreviewGoogle59.6% ↗
26
Gemini 3.6 FlashGoogle58.9% ↗
30
GLM-5.3-FlashZ.ai55.8% ↗
32
Kimi K2.7 CodeMoonshot AI54% ↗
33
GPT-5.4 miniOpenAI51.2% ↗
34
Gemini 3 Flash PreviewGoogle51.2% ↗
35
GPT-5 miniOpenAI46.7% ↗
36
DeepSeek V4 ProDeepSeek45.3% ↗
37
GPT-5.4 nanoOpenAI44.9% ↗
38
Grok 4.20 ReasoningxAI44.9% ↗
40
Qwen3.6-PlusQwen38.2% ↗