What is SimpleQA Verified?
A cleaned, verified version of the SimpleQA short-form factuality benchmark: fact-seeking questions a model must answer correctly from its own knowledge, without tools.
SimpleQA Verified scores by model
1
GPT-6 AstraOpenAI75.6% ↗
2
Gemini 3.1 Pro PreviewGoogle73.5% ↗
3
Claude Fable 5.1Anthropic70.8% ↗
4
GPT-5.6 SolOpenAI69.7% ↗
5
Gemini 3.8 FlashGoogle69.7% ↗
6
Gemini 3.7 FlashGoogle69.2% ↗
7
Gemini 3 Flash PreviewGoogle68.7% ↗
8
Gemini 3.6 FlashGoogle66.2% ↗
9
Gemini 3.5 FlashGoogle66.2% ↗
11
Claude Opus 5Anthropic59.9% ↗
12
Claude Opus 4.8Anthropic53% ↗
13
Claude Opus 4.7Anthropic51.7% ↗
21
DeepSeek V4 ProDeepSeek47% ↗
22
Claude Opus 4.6Anthropic47% ↗
23
GPT-5.4 ProOpenAI46.3% ↗
24
Qwen3.8-MaxQwen45.8% ↗
26
Qwen3.6-PlusQwen44.1% ↗
27
Gemini 3.1 Flash-LiteGoogle43.3% ↗
28
GPT-5.6 TerraOpenAI43.2% ↗
29
GPT-5.6 LunaOpenAI41% ↗
32
Kimi K2.7 CodeMoonshot AI36.5% ↗
33
Claude Sonnet 4.6Anthropic35.5% ↗
37
Claude Sonnet 5Anthropic33.7% ↗