ModelsCompareBest forBenchmarksStatusPricingAPI

What is SimpleQA Verified?

A cleaned, verified version of the SimpleQA short-form factuality benchmark: fact-seeking questions a model must answer correctly from its own knowledge, without tools.

SimpleQA Verified scores by model

1
GPT-6 AstraOpenAI75.6%
3
Claude Fable 5.1Anthropic70.8%
4
GPT-5.6 SolOpenAI69.7%
5
6
8
9
10
GPT-5.5OpenAI63%
11
Claude Opus 5Anthropic59.9%
12
Claude Opus 4.8Anthropic53%
13
Claude Opus 4.7Anthropic51.7%
14
Kimi K3Moonshot AI50.6%
15
GPT-5OpenAI50.1%
16
o3OpenAI49.4%
17
Grok 4.6xAI49.3%
18
Qwen3-MaxQwen48.7%
19
Grok 4.5xAI48.3%
20
GPT-5.1OpenAI48%
21
DeepSeek V4 ProDeepSeek47%
22
Claude Opus 4.6Anthropic47%
23
GPT-5.4 ProOpenAI46.3%
24
Qwen3.8-MaxQwen45.8%
25
GPT-5.4OpenAI45.1%
26
Qwen3.6-PlusQwen44.1%
28
GPT-5.6 TerraOpenAI43.2%
29
GPT-5.6 LunaOpenAI41%
30
GLM-5.3Z.ai41%
31
GPT-5.2OpenAI37.1%
32
Kimi K2.7 CodeMoonshot AI36.5%
33
Claude Sonnet 4.6Anthropic35.5%
34
Kimi K2.6Moonshot AI34.9%
35
GLM-5.2Z.ai34.2%
36
GLM-5.1Z.ai34%
37
Claude Sonnet 5Anthropic33.7%
38
Grok 4.3xAI33.2%
39
GLM-4.7Z.ai32.2%
40
GPT-4.1OpenAI31.1%