Reasoning benchmark

SimpleBench leaderboard

As of October 2026, Claude Fable 5 has the highest published SimpleBench score on Noometry at 81.9%, out of 77 models with results.

Last verified

About SimpleBench

Trick questions about space, time and social situations that most people answer easily but models often miss.

Category
Reasoning
Introduced
2024
Format
Multiple choice
Unit
Percent (random guessing ≈ 16.7%)
Official site
simple-bench.com

Top 15 models

Top models on SimpleBench
  1. Claude Fable 5 81.9%
  2. Claude Opus 5 80.6%
  3. Gemini 3.1 Pro Preview 79.6%
  4. GPT-5.5 Pro 76.9%
  5. Gemini 3.5 Flash 76.7%
  6. Gemini 3 Pro 76.4%
  7. Grok 4.6 75.9%
  8. Muse Spark 1.2 74.5%
  9. GPT-5.4 Pro 74.1%
  10. GPT-5.6 Sol 71.7%
  11. Qwen3.7 Max 70.4%
  12. Grok 4.5 70%
  13. GPT-5.5 69%
  14. Claude Opus 4.6 67.6%
  15. Claude Opus 4.8 64.8%

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

SimpleBench results by model
#ModelProviderScoreSettingSourceDate
1Claude Fable 5 Anthropic81.9%maxEpoch AI
2Claude Opus 5 Anthropic80.6%Epoch AI
3Gemini 3.1 Pro Preview Google79.6%Epoch AI
4GPT-5.5 Pro OpenAI76.9%Epoch AI
5Gemini 3.5 Flash Google76.7%Epoch AI
6Gemini 3 Pro Google76.4%Epoch AI
7Grok 4.6 xAI75.9%Epoch AI
8Muse Spark 1.2 Meta74.5%Epoch AI
9GPT-5.4 Pro OpenAI74.1%Epoch AI
10GPT-5.6 Sol OpenAI71.7%prounknownEpoch AI
11Qwen3.7 Max Alibaba (Qwen)70.4%Epoch AI
12Grok 4.5 xAI70%Epoch AI
13GPT-5.5 OpenAI69%Epoch AI
14Claude Opus 4.6 Anthropic67.6%Epoch AI
15Claude Opus 4.8 Anthropic64.8%Epoch AI
16Qwen3.6 Max Preview Alibaba (Qwen)63%Epoch AI
17Gemini 2.5 Pro Google62.4%Epoch AI
18Claude Opus 4.5 Anthropic62%Epoch AI
19Claude Opus 4.7 Anthropic61.7%Epoch AI
20GPT-5 Pro OpenAI61.6%Epoch AI
21DeepSeek V4 Flash DeepSeek61.1%Epoch AI
22Gemini 3 Flash Preview Google61.1%Epoch AI
23Kimi K3 Moonshot AI60.7%maxEpoch AI
24Claude Sonnet 5 Anthropic60.6%Epoch AI
25Grok 4 xAI60.5%Epoch AI
26Claude Opus 4.1 Anthropic60%Epoch AI
27Claude Opus 4 Anthropic58.8%Epoch AI
28GLM-5.2 Z.ai (Zhipu)58.8%Epoch AI
29Kimi K2.7 Code Moonshot AI57.9%Epoch AI
30GPT-5.2 Pro OpenAI57.4%Epoch AI
31GPT-5 OpenAI56.7%highEpoch AI
32Grok 4.1 Fast xAI56%Epoch AI
33Grok 4.1 Fast xAI56%Epoch AI
34GLM-5.1 Z.ai (Zhipu)55.1%Epoch AI
35Claude Sonnet 4.5 Anthropic54.3%Epoch AI
36GLM-5 Z.ai (Zhipu)53.2%Epoch AI
37GPT-5.1 OpenAI53.2%highEpoch AI
38o3 OpenAI53.1%highEpoch AI
39DeepSeek-V3.2-Speciale DeepSeek52.6%Epoch AI
40Inkling Thinking Machines Lab50%Epoch AI
41GPT-5.6 Terra OpenAI48.9%Epoch AI
42GLM-4.7 Z.ai (Zhipu)47.7%Epoch AI
43GLM-4.7 Z.ai (Zhipu)47.7%Epoch AI
44GPT-5.6 Luna OpenAI46.8%Epoch AI
45Kimi K2.5 Moonshot AI46.8%Epoch AI
46Claude 3.7 Sonnet Anthropic46.4%Epoch AI
47GPT-5.2 OpenAI45.8%Epoch AI
48MiniMax-M3 MiniMax45.8%Epoch AI
49Claude Sonnet 4 Anthropic45.5%Epoch AI
50o1 OpenAI41.7%Epoch AI
51Claude 3.5 Sonnet Anthropic41.4%Epoch AI
52Gemini 2.5 Flash Google41.2%Epoch AI
53DeepSeek-R1 DeepSeek40.8%Epoch AI
54DeepSeek-V3.1 DeepSeek40%Epoch AI
55o4-mini OpenAI38.7%highEpoch AI
56Grok 3 xAI36.1%Epoch AI
57Qwen3.6 Flash Alibaba (Qwen)35.2%Epoch AI
58GPT-4.5 OpenAI34.5%Epoch AI
59Gemini 2.0 Flash (Feb 2025) Google31.1%Epoch AI
60Qwen3 235B-A22B Alibaba (Qwen)31%Epoch AI
61Llama 4 Maverick Meta27.7%Epoch AI
62DeepSeek-V3 DeepSeek27.2%Epoch AI
63Gemini 1.5 Pro (May 2024) Google27.1%Epoch AI
64GPT-4.1 OpenAI27%Epoch AI
65Kimi K2 (Jul 2025) Moonshot AI26.3%Epoch AI
66GPT-4 Turbo OpenAI25.1%Epoch AI
67Claude 3 Opus Anthropic23.5%Epoch AI
68Llama 3.1-405B Meta23%Epoch AI
69o3-mini OpenAI22.8%highEpoch AI
70Grok-2 (Dec 2024) xAI22.7%Epoch AI
71Mistral Large Mistral AI22.5%Epoch AI
72gpt-oss-120b OpenAI22.1%Epoch AI
73Llama-3.3-70B-Instruct Meta19.9%Epoch AI
74o1-mini OpenAI18.1%mediumEpoch AI
75GPT-4o OpenAI17.8%Epoch AI
76Command R+ Cohere17.4%Epoch AI
77GPT-4o mini OpenAI10.7%Epoch AI

Compare the leaders

Other reasoning benchmarks

Frequently asked questions

What does SimpleBench measure?

Trick questions about space, time and social situations that most people answer easily but models often miss.

Which model has the highest SimpleBench score?

As of October 2026, Claude Fable 5 has the highest published SimpleBench score on Noometry at 81.9%, out of 77 models with results.

What is the best open-weight model on SimpleBench?

DeepSeek V4 Flash has the highest SimpleBench accuracy among open-weight models at 61.1%, ranking 21 of 77 overall.