Model comparison

Claude 3 Sonnet vs Claude Sonnet 4.5

Claude Sonnet 4.5 is the stronger model overall, scoring 44.1 to 29.0 on the Noometry Index.

Last verified . 23 shared benchmarks.

Claude 3 Sonnet Anthropic

29.0

Rank #319 Confirmed

Claude Sonnet 4.5 Anthropic

44.1

Rank #81 Confirmed

Summary

  • They share 23 benchmarks with published results for both. Claude 3 Sonnet scores higher in 0 categories and Claude Sonnet 4.5 in 9 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Claude Sonnet 4.5 leads 48.4 to 21.1.
  • The biggest single-benchmark swing is MATH Level 5: 18.2% for Claude 3 Sonnet and 97.7% for Claude Sonnet 4.5.

Side by side

Claude 3 Sonnet and Claude Sonnet 4.5 specifications
Claude 3 SonnetClaude Sonnet 4.5
ProviderAnthropicAnthropic
Noometry Index29.044.1
Released2024-02-292025-09-29
WeightsProprietaryProprietary
Context window—200K
Max output—64K
Input $ / M tokens—$3
Output $ / M tokens—$15
Results tracked3073

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 4.5 leads

Claude 3 Sonnet: 29.6 (#302), Claude Sonnet 4.5: 47.3 (#61)

Coding benchmarks
BenchmarkClaude 3 SonnetClaude Sonnet 4.5
WeirdML10.2%47.7%
LMArena Coding12231489
SWE-bench Verified—71.3%
SWE-bench Verified (bash only)—71.4%
LMArena WebDev—1393
SWE-bench Multilingual—67%
SciCode—44.7%
GSO—14.7%
BigCodeBench Instruct42.7%—
BigCodeBench Complete53.8%—
ALE-Bench—796.15
AlgoTune—1.52
HumanEval+64%—
MBPP+69.3%—

Agentic & Tool Use Not comparable

Claude 3 Sonnet: —, Claude Sonnet 4.5: 38.3 (#32)

Agentic & Tool Use benchmarks
BenchmarkClaude 3 SonnetClaude Sonnet 4.5
Terminal-Bench—46.5%
Berkeley Function Calling Leaderboard—73.2%
GDPval—42.5%
Remote Labor Index—2.1%
τ²-bench Airline—72%
τ²-bench Banking—25.3%
τ²-bench Retail—72.4%
τ²-bench Telecom—84.9%
Cybench—60%
DeepResearch Bench—52.6%
OSWorld—62.9%
LMArena Search—1159
METR Time Horizons—67.4%
Vending-Bench 2—3,839

Reasoning Claude Sonnet 4.5 leads

Claude 3 Sonnet: 20.5 (#237), Claude Sonnet 4.5: 26.9 (#125)

Reasoning benchmarks
BenchmarkClaude 3 SonnetClaude Sonnet 4.5
LMArena Hard Prompts11971462
DTBench53.6%83.2%
Epoch Capabilities Index120.7146.84
ARC-AGI-2—13.6%
SimpleBench—54.3%
Kagi LLM Benchmark—57.9%
NYT Connections (extended)—37.3%
ARC-AGI-1—63.7%
CritPt—1.1%
Chess Puzzles—12%
EnigmaEval—6%
EBR-Bench—2.4%
Mystery Game Puzzles—17%
LMCA—38.8%
ForecastBench—61.9
WinoGrande75.1%—

Math Claude Sonnet 4.5 leads

Claude 3 Sonnet: 10.7 (#310), Claude Sonnet 4.5: 32.3 (#216)

Math benchmarks
BenchmarkClaude 3 SonnetClaude Sonnet 4.5
OTIS Mock AIME 2024-20252.5%77.8%
LMArena Math12131449
MATH Level 518.2%97.7%
FrontierMath (Tiers 1-3)—23.9%
FrontierMath Tier 4—2.4%
ProofBench—19%
Omni-MATH—55.3%
FrontierMath (Feb 2025 set)—15.2%
FrontierMath Tier 4 (v1)—4.2%

Knowledge Claude Sonnet 4.5 leads

Claude 3 Sonnet: 21.1 (#276), Claude Sonnet 4.5: 48.4 (#76)

Knowledge benchmarks
BenchmarkClaude 3 SonnetClaude Sonnet 4.5
GPQA Diamond40.6%82.3%
LMArena Expert11731482
Humanity's Last Exam—13.7%
SimpleQA Verified—30.7%
MMLU-Pro—86.9%
Vectara Hallucination Rate—12%
GPQA (HELM)—68.6%
MMLU75.9%—

Multimodal Claude Sonnet 4.5 leads

Claude 3 Sonnet: 25.2 (#125), Claude Sonnet 4.5: 34.8 (#89)

Multimodal benchmarks
BenchmarkClaude 3 SonnetClaude Sonnet 4.5
LMArena Vision984—
VPCT—39.8%
LMArena Document—1450

Multilingual Claude Sonnet 4.5 leads

Claude 3 Sonnet: 37.8 (#234), Claude Sonnet 4.5: 53.4 (#69)

Multilingual benchmarks
BenchmarkClaude 3 SonnetClaude Sonnet 4.5
LMArena Non-English12051425
LMArena Chinese11891459
LMArena French12291458
LMArena German12041427
LMArena Japanese11311390
LMArena Korean11281403
LMArena Russian12271437
LMArena Spanish12041457

Instruction Following Claude Sonnet 4.5 leads

Claude 3 Sonnet: 62.8 (#235), Claude Sonnet 4.5: 75.0 (#78)

Instruction Following benchmarks
BenchmarkClaude 3 SonnetClaude Sonnet 4.5
LMArena Instruction Following11991459
IFEval—85%

Long Context Claude Sonnet 4.5 leads

Claude 3 Sonnet: 36.7 (#228), Claude Sonnet 4.5: 45.2 (#46)

Long Context benchmarks
BenchmarkClaude 3 SonnetClaude Sonnet 4.5
LMArena Longer Query12111476

Writing & Preference Claude Sonnet 4.5 leads

Claude 3 Sonnet: 42.1 (#238), Claude Sonnet 4.5: 66.5 (#34)

Writing & Preference benchmarks
BenchmarkClaude 3 SonnetClaude Sonnet 4.5
LMArena Text12181439
LMArena Creative Writing11861442
LMArena Multi-Turn12271465
EQ-Bench Creative Writing—1678
WildBench—85.4%

Frequently asked questions

Is Claude 3 Sonnet better than Claude Sonnet 4.5?

Claude Sonnet 4.5 is the stronger model overall, scoring 44.1 to 29.0 on the Noometry Index.

Is Claude 3 Sonnet or Claude Sonnet 4.5 better for coding?

Claude Sonnet 4.5 scores higher on coding benchmarks: 47.3 versus 29.6 in the Noometry coding category.

How many benchmarks do Claude 3 Sonnet and Claude Sonnet 4.5 share?

23 benchmarks have published results for both models. Claude 3 Sonnet has 30 scored results on Noometry and Claude Sonnet 4.5 has 73.

Related comparisons

Go deeper