Reasoning benchmark

DTBench leaderboard

As of October 2026, Claude Opus 5.5 has the highest published DTBench score on Noometry at 98.9%, out of 151 models with results.

Last verified

About DTBench

A description with primary sources is being prepared for this benchmark.

Category
Reasoning
Introduced
2026
Unit
Percent (random guessing ≈ 40%)
Official site
epoch.ai

Top 15 models

Top models on DTBench
  1. Claude Opus 5.5 98.9%
  2. Claude Fable 5 98.4%
  3. Claude Opus 5 97.9%
  4. Claude Fable 5.1 97.6%
  5. GPT-6 Astra 97.3%
  6. GPT-6 Sol 97.3%
  7. Grok 4.6 97.3%
  8. Gemini 3.1 Pro Preview 97.1%
  9. Gemini 3.7 Flash 96.8%
  10. Grok 4.5 96.5%
  11. Muse Spark 1.3 96.5%
  12. GPT-5.5 96%
  13. GPT-5.5 Pro 96%
  14. GPT-5.6 Sol 96%
  15. Grok 4.7 96%

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

DTBench results by model
#ModelProviderScoreSettingSourceDate
1Claude Opus 5.5 Anthropic98.9%maxEpoch AI
2Claude Fable 5 Anthropic98.4%maxEpoch AI
3Claude Opus 5 Anthropic97.9%highEpoch AI
4Claude Fable 5.1 Anthropic97.6%Epoch AI
5GPT-6 Astra OpenAI97.3%xhighEpoch AI
6GPT-6 Sol OpenAI97.3%maxEpoch AI
7Grok 4.6 xAI97.3%xhighEpoch AI
8Gemini 3.1 Pro Preview Google97.1%mediumEpoch AI
9Gemini 3.7 Flash Google96.8%highEpoch AI
10Grok 4.5 xAI96.5%highEpoch AI
11Muse Spark 1.3 Meta96.5%Epoch AI
12GPT-5.5 OpenAI96%xhighEpoch AI
13GPT-5.5 Pro OpenAI96%xhighEpoch AI
14GPT-5.6 Sol OpenAI96%promaxEpoch AI
15Grok 4.7 xAI96%xhighEpoch AI
16Gemini 3.8 Flash Google95.7%Epoch AI
17Gemini 3.6 Flash Google95.5%highEpoch AI
18Claude Opus 4.8 Anthropic94.9%maxEpoch AI
19Gemini 3.5 Flash Google94.7%highEpoch AI
20Muse Spark 1.2 Meta94.7%xhighEpoch AI
21Claude Opus 4.7 Anthropic94.7%maxEpoch AI
22GPT-5.4 OpenAI94.4%xhighEpoch AI
23Muse Spark 1.1 Meta94.4%highEpoch AI
24DeepSeek V4 Pro DeepSeek93.9%Epoch AI
25GLM-5.2 Z.ai (Zhipu)93.6%maxEpoch AI
26GPT-5.6 Terra OpenAI93.3%maxEpoch AI
27Claude Sonnet 5 Anthropic92.5%maxEpoch AI
28Qwen3.7 Max Alibaba (Qwen)92.3%Epoch AI
29Qwen3.8 Max Alibaba (Qwen)92%xhighEpoch AI
30Claude Opus 4.6 Anthropic91.2%maxEpoch AI
31Kimi K3 Moonshot AI91.2%maxEpoch AI
32DeepSeek V4 Flash DeepSeek90.9%maxEpoch AI
33GPT-5.2 OpenAI90.9%xhighEpoch AI
34Kimi K2.6 Moonshot AI90.9%Epoch AI
35GPT-5 OpenAI90.7%highEpoch AI
36Grok 4.3 xAI90.7%highEpoch AI
37GPT-5.1 OpenAI90.1%highEpoch AI
38GPT-6 Luna OpenAI90.1%maxEpoch AI
39Grok 4.20 (Non-Reasoning) xAI90.1%Epoch AI
40Nemotron 3 Ultra NVIDIA90.1%Epoch AI
41Claude Opus 4.5 Anthropic89.9%highEpoch AI
42Claude Sonnet 4.6 Anthropic89.9%maxEpoch AI
43DeepSeek V4.1 Flash DeepSeek89.9%Epoch AI
44Gemini 3 Flash Preview Google89.1%highEpoch AI
45GPT-5.6 Luna OpenAI89.1%xhighEpoch AI
46Qwen3.8 27B Alibaba (Qwen)88%Epoch AI
47DeepSeek-V3.2-Exp DeepSeek87.7%thinkingEpoch AI
48Grok 4.1 Fast xAI87.7%Epoch AI
49GLM-5.3 Z.ai (Zhipu)87.7%Epoch AI
50Inkling Thinking Machines Lab87.5%xhighEpoch AI
51Qwen3.5 397B-A17B Alibaba (Qwen)87.5%Epoch AI
52Qwen3.6 Max Preview Alibaba (Qwen)87.2%Epoch AI
53o3-pro OpenAI86.9%highEpoch AI
54o3 OpenAI84.8%highEpoch AI
55MiMo-V2.5-Pro Xiaomi84.5%Epoch AI
56Qwen3.5 122B-A10B Alibaba (Qwen)84.3%noneEpoch AI
57Qwen3.7 Plus Alibaba (Qwen)84%Epoch AI
58Gemini 3.5 Flash Lite Google83.5%highEpoch AI
59Claude Sonnet 4.5 Anthropic83.2%Epoch AI
60Qwen3.5-Flash Alibaba (Qwen)82.9%Epoch AI
61DeepSeek-V3.1 DeepSeek82.7%thinkingEpoch AI
62Gemma 4 31B IT Google82.7%Epoch AI
63Grok 4 Fast xAI82.7%Epoch AI
64Gemini 2.5 Pro Google82.4%Epoch AI
65Qwen3.5 27B Alibaba (Qwen)82.4%Epoch AI
66Qwen3 Max Alibaba (Qwen)82.1%Epoch AI
67Qwen3.6 Plus Alibaba (Qwen)81.9%Epoch AI
68Claude Opus 4 Anthropic81.6%Epoch AI
69DeepSeek-V3.1-Terminus DeepSeek81.3%Epoch AI
70Qwen Plus Alibaba (Qwen)81.1%Epoch AI
71GPT-5 Mini OpenAI80.5%highEpoch AI
72Qwen3.5 Plus Alibaba (Qwen)80.5%Epoch AI
73GPT-5.4 nano OpenAI80.3%xhighEpoch AI
74Qwen3 235B-A22B Alibaba (Qwen)80.3%Epoch AI
75Claude Opus 4.1 Anthropic80%Epoch AI
76GPT-5.4 mini OpenAI80%xhighEpoch AI
77Qwen3.5 35B-A3B Alibaba (Qwen)80%Epoch AI
78MiniMax-M3 MiniMax78.9%Epoch AI
79Qwen3.6 27B Alibaba (Qwen)78.1%Epoch AI
80o4-mini OpenAI77.6%highEpoch AI
81Claude Sonnet 4 Anthropic77.1%Epoch AI
82Qwen3.6 Flash Alibaba (Qwen)77.1%Epoch AI
83Gemini 3.1 Flash Lite Google76.8%highEpoch AI
84Gemini 2.5 Flash Google76.5%Epoch AI
85gpt-oss-120b OpenAI76.3%highEpoch AI
86Mistral Medium Mistral AI75.5%Epoch AI
87Gemma 4 26B A4B IT Google74.9%Epoch AI
88o1 OpenAI74.7%highEpoch AI
89Qwen3.6 35B-A3B Alibaba (Qwen)73.9%Epoch AI
90Claude Haiku 4.5 Anthropic73.6%Epoch AI
91Qwen3.5-9B Alibaba (Qwen)71.2%Epoch AI
92Mistral Small Mistral AI70.9%Epoch AI
93Qwen3-30B-A3B Alibaba (Qwen)69.3%Epoch AI
94GPT-4.1 mini OpenAI68.8%Epoch AI
95o3-mini OpenAI68.8%highEpoch AI
96GPT-4.1 OpenAI68.3%Epoch AI
97gpt-oss-20b OpenAI68%highEpoch AI
98Claude 3.5 Sonnet Anthropic67.8%Epoch AI
99Qwen3 32B Alibaba (Qwen)67.5%Epoch AI
100Grok-2 (Dec 2024) xAI65.2%Epoch AI
101Mistral Large Mistral AI65.1%Epoch AI
102DeepSeek-V3 DeepSeek64.8%Epoch AI
103GPT-4o OpenAI64.5%Epoch AI
104Qwen3 14B Alibaba (Qwen)64%Epoch AI
105Gemini 2.0 Flash (Feb 2025) Google63.2%Epoch AI
106Qwen2.5 72B Instruct Alibaba (Qwen)62.9%Epoch AI
107Gemini 2.5 Flash-Lite Google62.8%Epoch AI
108GPT-4 OpenAI62.7%Epoch AI
109GPT-5 Nano OpenAI62.7%highEpoch AI
110Llama 4 Maverick Meta61.9%Epoch AI
111Claude 3 Opus Anthropic61.6%Epoch AI
112GPT-4 Turbo OpenAI61.6%Epoch AI
113Llama 3.1-405B Meta61.4%Epoch AI
114Command A Cohere61.3%Epoch AI
115Magistral Small Mistral AI61.3%Epoch AI
116Llama 3.1-70B Meta60%Epoch AI
117Qwen3 8B Alibaba (Qwen)59.7%Epoch AI
118Llama-3.3-70B-Instruct Meta59.5%Epoch AI
119Gemini 1.5 Pro (May 2024) Google59%Epoch AI
120Llama 4 Scout Meta57.9%Epoch AI
121Claude 3.5 Haiku Anthropic56.7%Epoch AI
122Mixtral 8x22B Mistral AI55.1%Epoch AI
123Command R+ Cohere54.9%Epoch AI
124GPT-4o mini OpenAI54.4%Epoch AI
125Llama 3-70B Meta54.2%Epoch AI
126Gemini 1.5 Flash (May 2024) Google53.8%Epoch AI
127Claude 3 Sonnet Anthropic53.6%Epoch AI
128Gemini 2.0 Flash-Lite Google52.5%Epoch AI
129Gemma 3 27B Google52.5%Epoch AI
130GPT-4.1 nano OpenAI52.5%Epoch AI
131Claude 2 Anthropic51.9%Epoch AI
132Ministral 3B Mistral AI51.7%Epoch AI
133Claude 2.1 Anthropic51%Epoch AI
134Gemma 3 4B Google50.9%Epoch AI
135Llama 3.1-8B Meta50.9%Epoch AI
136Claude 3 Haiku Anthropic50.1%Epoch AI
137Gemini 1.5 Flash 8B Google50%Epoch AI
138Mixtral 8x7B Mistral AI49.6%Epoch AI
139Gemma 3 12B Google48.8%Epoch AI
140Mistral Nemo Mistral AI48.6%Epoch AI
141GPT-3.5-turbo OpenAI48.5%Epoch AI
142Gemma 2 27B Google48%Epoch AI
143Qwen2.5 7B Instruct Alibaba (Qwen)47.7%Epoch AI
144Command R Cohere46.4%Epoch AI
145Gemini 1.0 Pro Google45.9%Epoch AI
146Claude Instant Anthropic45.8%Epoch AI
147Ministral 8B Mistral AI45.7%Epoch AI
148Llama 3-8B Meta43.9%Epoch AI
149Mistral 7B Mistral AI42.5%Epoch AI
150Llama 2-13B Meta42.2%Epoch AI
151Llama 2-70B Meta41.6%Epoch AI

Compare the leaders

Other reasoning benchmarks

Frequently asked questions

Which model has the highest DTBench score?

As of October 2026, Claude Opus 5.5 has the highest published DTBench score on Noometry at 98.9%, out of 151 models with results.

What is the best open-weight model on DTBench?

DeepSeek V4 Pro has the highest DTBench accuracy among open-weight models at 93.9%, ranking 24 of 151 overall.