Model comparison

Claude 3.7 Sonnet vs o3-mini

Claude 3.7 Sonnet is the stronger model overall, scoring 39.5 to 36.7 on the Noometry Index.

Last verified . 40 shared benchmarks.

Claude 3.7 Sonnet Anthropic

39.5

Rank #164 Confirmed

o3-mini OpenAI

36.7

Rank #212 Confirmed

Summary

  • They share 40 benchmarks with published results for both. Claude 3.7 Sonnet scores higher in 6 categories and o3-mini in 3 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in long context, where Claude 3.7 Sonnet leads 50.3 to 33.8.
  • The biggest single-benchmark swing is Fiction.LiveBench: 83.3% for Claude 3.7 Sonnet and 50% for o3-mini.

Side by side

Claude 3.7 Sonnet and o3-mini specifications
Claude 3.7 Sonneto3-mini
ProviderAnthropicOpenAI
Noometry Index39.536.7
Released2025-02-242024-12-20
WeightsProprietaryProprietary
Context window—200K
Max output—100K
Input $ / M tokens—$1.10
Output $ / M tokens—$4.40
Results tracked5851

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

Claude 3.7 Sonnet: 40.6 (#136), o3-mini: 40.8 (#132)

Coding benchmarks
BenchmarkClaude 3.7 Sonneto3-mini
Aider Polyglot64.9%60.4%
GSO3.8%1.3%
LiveBench Coding74.5%82.7%
LMArena Coding13611378
CadEval54%54%
SWE-bench Verified61%—
SWE-bench Verified (bash only)52.8%—
SciCode—39.8%
WeirdML—43.7%

Agentic & Tool Use Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 34.1 (#50), o3-mini: 29.6 (#84)

Agentic & Tool Use benchmarks
BenchmarkClaude 3.7 Sonneto3-mini
Cybench20%22.5%
TheAgentCompany30.9%—
DeepResearch Bench43.6%—
OSWorld35.8%—
METR Time Horizons60%—

Reasoning Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 18.6 (#277), o3-mini: 16.3 (#305)

Reasoning benchmarks
BenchmarkClaude 3.7 Sonneto3-mini
ARC-AGI-20.9%3%
SimpleBench46.4%22.8%
ARC-AGI-128.6%34.5%
LiveBench Reasoning87.8%89.6%
LMArena Hard Prompts13331366
LiveBench Data Analysis74%70.6%
Epoch Capabilities Index141.16140.34
ForecastBench61.859.6
LiveBench76.1%75.9%
CritPt—0.3%
Chess Puzzles—17%
EnigmaEval4.2%—
Mystery Game Puzzles—7%
DTBench—68.8%
LMCA—19%

Math Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 37.5 (#153), o3-mini: 28.1 (#244)

Math benchmarks
BenchmarkClaude 3.7 Sonneto3-mini
OTIS Mock AIME 2024-202557.8%76.9%
LiveBench Math79%77.3%
LMArena Math13371396
MATH Level 591.2%96.5%
FrontierMath (Feb 2025 set)4.1%12.4%
FrontierMath (Tiers 1-3)—18.6%
FrontierMath Tier 4—0%
Omni-MATH33%—
FrontierMath Tier 4 (v1)—4.2%

Knowledge Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 39.8 (#130), o3-mini: 38.3 (#146)

Knowledge benchmarks
BenchmarkClaude 3.7 Sonneto3-mini
GPQA Diamond79.7%77%
Confabulations14.7%17.9%
LMArena Expert13211364
Humanity's Last Exam8%—
SimpleQA Verified—15.3%
MMLU-Pro78.4%—
GPQA (HELM)60.8%—

Multimodal Not comparable

Claude 3.7 Sonnet: 33.7 (#95), o3-mini: —

Multimodal benchmarks
BenchmarkClaude 3.7 Sonneto3-mini
LMArena Vision1169—
GeoBench68%—
VPCT39%—
SpatialViz-Bench33.9%—

Multilingual o3-mini leads

Claude 3.7 Sonnet: 44.1 (#179), o3-mini: 45.7 (#164)

Multilingual benchmarks
BenchmarkClaude 3.7 Sonneto3-mini
LMArena Non-English12961319
LMArena Chinese12991379
LMArena French13031334
LMArena German13011303
LMArena Japanese12671286
LMArena Korean12491314
LMArena Russian13111304
LMArena Spanish12981321

Instruction Following o3-mini leads

Claude 3.7 Sonnet: 72.9 (#125), o3-mini: 75.1 (#72)

Instruction Following benchmarks
BenchmarkClaude 3.7 Sonneto3-mini
LiveBench Instruction Following81.3%84.4%
LMArena Instruction Following13521337
IFEval83.4%—

Long Context Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 50.3 (#10), o3-mini: 33.8 (#256)

Long Context benchmarks
BenchmarkClaude 3.7 Sonneto3-mini
Fiction.LiveBench83.3%50%
LMArena Longer Query13731343

Writing & Preference Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 54.4 (#150), o3-mini: 50.3 (#182)

Writing & Preference benchmarks
BenchmarkClaude 3.7 Sonneto3-mini
LMArena Text13141337
LMArena Creative Writing13321286
Short-Story Creative Writing81.1%61.7%
LMArena Multi-Turn13391320
LiveBench Language59.9%50.7%
EQ-Bench Creative Writing1412—
WildBench81.4%—

Frequently asked questions

Is Claude 3.7 Sonnet better than o3-mini?

Claude 3.7 Sonnet is the stronger model overall, scoring 39.5 to 36.7 on the Noometry Index.

Is Claude 3.7 Sonnet or o3-mini better for coding?

They score almost the same on coding (40.6 vs 40.8); test both on your own repository before choosing.

How many benchmarks do Claude 3.7 Sonnet and o3-mini share?

40 benchmarks have published results for both models. Claude 3.7 Sonnet has 58 scored results on Noometry and o3-mini has 51.

Related comparisons

Go deeper