Model comparison

Amazon Nova Experimental Chat 10 09 vs Claude Sonnet 4.5

Claude Sonnet 4.5 is the stronger model overall, scoring 44.1 to 41.9 on the Noometry Index.

Last verified . 9 shared benchmarks.

Claude Sonnet 4.5 Anthropic

44.1

Rank #81 Confirmed

Summary

  • They share 9 benchmarks with published results for both. Amazon Nova Experimental Chat 10 09 scores higher in 1 category and Claude Sonnet 4.5 in 5 categories; 5 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Claude Sonnet 4.5 leads 66.5 to 54.7.

Side by side

Amazon Nova Experimental Chat 10 09 and Claude Sonnet 4.5 specifications
Amazon Nova Experimental Chat 10 09Claude Sonnet 4.5
ProviderAmazonAnthropic
Noometry Index41.944.1
Released—2025-09-29
WeightsProprietaryProprietary
Context window—200K
Max output—64K
Input $ / M tokens—$3
Output $ / M tokens—$15
Results tracked973

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 4.5 leads

Amazon Nova Experimental Chat 10 09: 40.2 (#145), Claude Sonnet 4.5: 47.3 (#61)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Claude Sonnet 4.5
LMArena Coding13701489
SWE-bench Verified—71.3%
SWE-bench Verified (bash only)—71.4%
LMArena WebDev—1393
SWE-bench Multilingual—67%
SciCode—44.7%
GSO—14.7%
WeirdML—47.7%
ALE-Bench—796.15
AlgoTune—1.52

Agentic & Tool Use Not comparable

Amazon Nova Experimental Chat 10 09: —, Claude Sonnet 4.5: 38.3 (#32)

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Claude Sonnet 4.5
Terminal-Bench—46.5%
Berkeley Function Calling Leaderboard—73.2%
GDPval—42.5%
Remote Labor Index—2.1%
τ²-bench Airline—72%
τ²-bench Banking—25.3%
τ²-bench Retail—72.4%
τ²-bench Telecom—84.9%
Cybench—60%
DeepResearch Bench—52.6%
OSWorld—62.9%
LMArena Search—1159
METR Time Horizons—67.4%
Vending-Bench 2—3,839

Reasoning Too close to call

Amazon Nova Experimental Chat 10 09: 27.3 (#120), Claude Sonnet 4.5: 26.9 (#125)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Claude Sonnet 4.5
LMArena Hard Prompts13561462
ARC-AGI-2—13.6%
SimpleBench—54.3%
Kagi LLM Benchmark—57.9%
NYT Connections (extended)—37.3%
ARC-AGI-1—63.7%
CritPt—1.1%
Chess Puzzles—12%
EnigmaEval—6%
EBR-Bench—2.4%
Mystery Game Puzzles—17%
DTBench—83.2%
LMCA—38.8%
Epoch Capabilities Index—146.84
ForecastBench—61.9

Math Not comparable

Amazon Nova Experimental Chat 10 09: —, Claude Sonnet 4.5: 32.3 (#216)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Claude Sonnet 4.5
FrontierMath (Tiers 1-3)—23.9%
FrontierMath Tier 4—2.4%
OTIS Mock AIME 2024-2025—77.8%
ProofBench—19%
Omni-MATH—55.3%
LMArena Math—1449
MATH Level 5—97.7%
FrontierMath (Feb 2025 set)—15.2%
FrontierMath Tier 4 (v1)—4.2%

Knowledge Not comparable

Amazon Nova Experimental Chat 10 09: —, Claude Sonnet 4.5: 48.4 (#76)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Claude Sonnet 4.5
GPQA Diamond—82.3%
Humanity's Last Exam—13.7%
SimpleQA Verified—30.7%
MMLU-Pro—86.9%
Vectara Hallucination Rate—12%
GPQA (HELM)—68.6%
LMArena Expert—1482

Multimodal Not comparable

Amazon Nova Experimental Chat 10 09: —, Claude Sonnet 4.5: 34.8 (#89)

Multimodal benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Claude Sonnet 4.5
VPCT—39.8%
LMArena Document—1450

Multilingual Claude Sonnet 4.5 leads

Amazon Nova Experimental Chat 10 09: 47.3 (#150), Claude Sonnet 4.5: 53.4 (#69)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Claude Sonnet 4.5
LMArena Non-English13401425
LMArena Chinese13411459
LMArena French—1458
LMArena German—1427
LMArena Japanese—1390
LMArena Korean—1403
LMArena Russian—1437
LMArena Spanish—1457

Instruction Following Claude Sonnet 4.5 leads

Amazon Nova Experimental Chat 10 09: 69.4 (#172), Claude Sonnet 4.5: 75.0 (#78)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Claude Sonnet 4.5
LMArena Instruction Following13151459
IFEval—85%

Long Context Claude Sonnet 4.5 leads

Amazon Nova Experimental Chat 10 09: 40.5 (#152), Claude Sonnet 4.5: 45.2 (#46)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Claude Sonnet 4.5
LMArena Longer Query13331476

Writing & Preference Claude Sonnet 4.5 leads

Amazon Nova Experimental Chat 10 09: 54.7 (#149), Claude Sonnet 4.5: 66.5 (#34)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Claude Sonnet 4.5
LMArena Text13641439
LMArena Creative Writing13071442
LMArena Multi-Turn13551465
EQ-Bench Creative Writing—1678
WildBench—85.4%

Frequently asked questions

Is Amazon Nova Experimental Chat 10 09 better than Claude Sonnet 4.5?

Claude Sonnet 4.5 is the stronger model overall, scoring 44.1 to 41.9 on the Noometry Index.

Is Amazon Nova Experimental Chat 10 09 or Claude Sonnet 4.5 better for coding?

Claude Sonnet 4.5 scores higher on coding benchmarks: 47.3 versus 40.2 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 10 09 and Claude Sonnet 4.5 share?

9 benchmarks have published results for both models. Amazon Nova Experimental Chat 10 09 has 9 scored results on Noometry and Claude Sonnet 4.5 has 73.

Related comparisons

Go deeper