Model comparison

Claude 3.7 Sonnet vs Claude Sonnet 4.5

Claude Sonnet 4.5 is the stronger model overall, scoring 44.1 to 39.5 on the Noometry Index.

Last verified . 42 shared benchmarks.

Claude 3.7 Sonnet Anthropic

39.5

Rank #164 Confirmed

Claude Sonnet 4.5 Anthropic

44.1

Rank #81 Confirmed

Summary

  • They share 42 benchmarks with published results for both. Claude 3.7 Sonnet scores higher in 2 categories and Claude Sonnet 4.5 in 8 categories; 10 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Claude Sonnet 4.5 leads 66.5 to 54.4.
  • The biggest single-benchmark swing is Cybench: 20% for Claude 3.7 Sonnet and 60% for Claude Sonnet 4.5.

Side by side

Claude 3.7 Sonnet and Claude Sonnet 4.5 specifications
Claude 3.7 SonnetClaude Sonnet 4.5
ProviderAnthropicAnthropic
Noometry Index39.544.1
Released2025-02-242025-09-29
WeightsProprietaryProprietary
Context window—200K
Max output—64K
Input $ / M tokens—$3
Output $ / M tokens—$15
Results tracked5873

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 4.5 leads

Claude 3.7 Sonnet: 40.6 (#136), Claude Sonnet 4.5: 47.3 (#61)

Coding benchmarks
BenchmarkClaude 3.7 SonnetClaude Sonnet 4.5
SWE-bench Verified61%71.3%
SWE-bench Verified (bash only)52.8%71.4%
GSO3.8%14.7%
LMArena Coding13611489
Aider Polyglot64.9%—
LMArena WebDev—1393
SWE-bench Multilingual—67%
SciCode—44.7%
WeirdML—47.7%
LiveBench Coding74.5%—
CadEval54%—
ALE-Bench—796.15
AlgoTune—1.52

Agentic & Tool Use Claude Sonnet 4.5 leads

Claude 3.7 Sonnet: 34.1 (#50), Claude Sonnet 4.5: 38.3 (#32)

Agentic & Tool Use benchmarks
BenchmarkClaude 3.7 SonnetClaude Sonnet 4.5
Cybench20%60%
DeepResearch Bench43.6%52.6%
OSWorld35.8%62.9%
METR Time Horizons60%67.4%
Terminal-Bench—46.5%
Berkeley Function Calling Leaderboard—73.2%
GDPval—42.5%
Remote Labor Index—2.1%
TheAgentCompany30.9%—
τ²-bench Airline—72%
τ²-bench Banking—25.3%
τ²-bench Retail—72.4%
τ²-bench Telecom—84.9%
LMArena Search—1159
Vending-Bench 2—3,839

Reasoning Claude Sonnet 4.5 leads

Claude 3.7 Sonnet: 18.6 (#277), Claude Sonnet 4.5: 26.9 (#125)

Reasoning benchmarks
BenchmarkClaude 3.7 SonnetClaude Sonnet 4.5
ARC-AGI-20.9%13.6%
SimpleBench46.4%54.3%
ARC-AGI-128.6%63.7%
EnigmaEval4.2%6%
LMArena Hard Prompts13331462
Epoch Capabilities Index141.16146.84
ForecastBench61.861.9
Kagi LLM Benchmark—57.9%
NYT Connections (extended)—37.3%
CritPt—1.1%
Chess Puzzles—12%
EBR-Bench—2.4%
LiveBench Reasoning87.8%—
Mystery Game Puzzles—17%
DTBench—83.2%
LiveBench Data Analysis74%—
LMCA—38.8%
LiveBench76.1%—

Math Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 37.5 (#153), Claude Sonnet 4.5: 32.3 (#216)

Math benchmarks
BenchmarkClaude 3.7 SonnetClaude Sonnet 4.5
OTIS Mock AIME 2024-202557.8%77.8%
Omni-MATH33%55.3%
LMArena Math13371449
MATH Level 591.2%97.7%
FrontierMath (Feb 2025 set)4.1%15.2%
FrontierMath (Tiers 1-3)—23.9%
FrontierMath Tier 4—2.4%
ProofBench—19%
LiveBench Math79%—
FrontierMath Tier 4 (v1)—4.2%

Knowledge Claude Sonnet 4.5 leads

Claude 3.7 Sonnet: 39.8 (#130), Claude Sonnet 4.5: 48.4 (#76)

Knowledge benchmarks
BenchmarkClaude 3.7 SonnetClaude Sonnet 4.5
GPQA Diamond79.7%82.3%
Humanity's Last Exam8%13.7%
MMLU-Pro78.4%86.9%
GPQA (HELM)60.8%68.6%
LMArena Expert13211482
SimpleQA Verified—30.7%
Confabulations14.7%—
Vectara Hallucination Rate—12%

Multimodal Claude Sonnet 4.5 leads

Claude 3.7 Sonnet: 33.7 (#95), Claude Sonnet 4.5: 34.8 (#89)

Multimodal benchmarks
BenchmarkClaude 3.7 SonnetClaude Sonnet 4.5
VPCT39%39.8%
LMArena Vision1169—
GeoBench68%—
LMArena Document—1450
SpatialViz-Bench33.9%—

Multilingual Claude Sonnet 4.5 leads

Claude 3.7 Sonnet: 44.1 (#179), Claude Sonnet 4.5: 53.4 (#69)

Multilingual benchmarks
BenchmarkClaude 3.7 SonnetClaude Sonnet 4.5
LMArena Non-English12961425
LMArena Chinese12991459
LMArena French13031458
LMArena German13011427
LMArena Japanese12671390
LMArena Korean12491403
LMArena Russian13111437
LMArena Spanish12981457

Instruction Following Claude Sonnet 4.5 leads

Claude 3.7 Sonnet: 72.9 (#125), Claude Sonnet 4.5: 75.0 (#78)

Instruction Following benchmarks
BenchmarkClaude 3.7 SonnetClaude Sonnet 4.5
IFEval83.4%85%
LMArena Instruction Following13521459
LiveBench Instruction Following81.3%—

Long Context Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 50.3 (#10), Claude Sonnet 4.5: 45.2 (#46)

Long Context benchmarks
BenchmarkClaude 3.7 SonnetClaude Sonnet 4.5
LMArena Longer Query13731476
Fiction.LiveBench83.3%—

Writing & Preference Claude Sonnet 4.5 leads

Claude 3.7 Sonnet: 54.4 (#150), Claude Sonnet 4.5: 66.5 (#34)

Writing & Preference benchmarks
BenchmarkClaude 3.7 SonnetClaude Sonnet 4.5
LMArena Text13141439
LMArena Creative Writing13321442
EQ-Bench Creative Writing14121678
WildBench81.4%85.4%
LMArena Multi-Turn13391465
Short-Story Creative Writing81.1%—
LiveBench Language59.9%—

Frequently asked questions

Is Claude 3.7 Sonnet better than Claude Sonnet 4.5?

Claude Sonnet 4.5 is the stronger model overall, scoring 44.1 to 39.5 on the Noometry Index.

Is Claude 3.7 Sonnet or Claude Sonnet 4.5 better for coding?

Claude Sonnet 4.5 scores higher on coding benchmarks: 47.3 versus 40.6 in the Noometry coding category.

How many benchmarks do Claude 3.7 Sonnet and Claude Sonnet 4.5 share?

42 benchmarks have published results for both models. Claude 3.7 Sonnet has 58 scored results on Noometry and Claude Sonnet 4.5 has 73.

Related comparisons

Go deeper