Model comparison

Amazon Nova Experimental Chat 26 01 10 vs Claude Sonnet 4.6

Claude Sonnet 4.6 is the stronger model overall, scoring 50.3 to 42.8 on the Noometry Index.

Last verified . 13 shared benchmarks.

Claude Sonnet 4.6 Anthropic

50.3

Rank #50 Confirmed

Summary

  • They share 13 benchmarks with published results for both. Amazon Nova Experimental Chat 26 01 10 scores higher in 0 categories and Claude Sonnet 4.6 in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Claude Sonnet 4.6 leads 46.1 to 28.9.

Side by side

Amazon Nova Experimental Chat 26 01 10 and Claude Sonnet 4.6 specifications
Amazon Nova Experimental Chat 26 01 10Claude Sonnet 4.6
ProviderAmazonAnthropic
Noometry Index42.850.3
Released—2026-02-17
WeightsProprietaryProprietary
Context window—1M
Max output—128K
Input $ / M tokens—$3
Output $ / M tokens—$15
Results tracked1357

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 4.6 leads

Amazon Nova Experimental Chat 26 01 10: 42.7 (#96), Claude Sonnet 4.6: 46.3 (#67)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Claude Sonnet 4.6
LMArena Coding14471504
SWE-bench Verified—75.2%
DeepSWE—29.9%
FrontierCode—24.3%
LMArena WebDev—1522
SciCode—46.8%
WeirdML—66.1%
ALE-Bench—1,327

Agentic & Tool Use Not comparable

Amazon Nova Experimental Chat 26 01 10: —, Claude Sonnet 4.6: 39.1 (#28)

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Claude Sonnet 4.6
Terminal-Bench—53.4%
APEX-Agents—43%
OSWorld 2.0—9.3%
DeepResearch Bench—54.9%
OSWorld—72.1%
ExploitBench—23.6%
GBAEval—48.8%
GDP.pdf—18%
LMArena Search—1221
Vending-Bench 2—7,204

Reasoning Claude Sonnet 4.6 leads

Amazon Nova Experimental Chat 26 01 10: 28.9 (#98), Claude Sonnet 4.6: 46.1 (#45)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Claude Sonnet 4.6
LMArena Hard Prompts14151484
ARC-AGI-2—60.4%
NYT Connections (extended)—80.9%
ARC-AGI-1—86.5%
CritPt—3.1%
Chess Puzzles—13%
Thematic Generalization—76.3%
Mystery Game Puzzles—16%
DTBench—89.9%
LMCA—46.5%
Epoch Capabilities Index—152.24
ForecastBench—62

Math Claude Sonnet 4.6 leads

Amazon Nova Experimental Chat 26 01 10: 38.5 (#136), Claude Sonnet 4.6: 52.9 (#49)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Claude Sonnet 4.6
LMArena Math14041462
OTIS Mock AIME 2024-2025—85.8%
ProofBench—45%
FrontierMath (Feb 2025 set)—32.4%
FrontierMath Tier 4 (v1)—8.3%

Knowledge Claude Sonnet 4.6 leads

Amazon Nova Experimental Chat 26 01 10: 40.3 (#120), Claude Sonnet 4.6: 51.7 (#65)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Claude Sonnet 4.6
LMArena Expert14441500
GPQA Diamond—87.4%
SimpleQA Verified—35.5%
Vectara Hallucination Rate—10.6%

Multimodal Not comparable

Amazon Nova Experimental Chat 26 01 10: —, Claude Sonnet 4.6: 38.0 (#68)

Multimodal benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Claude Sonnet 4.6
LMArena Vision—1283
Blueprint-Bench 2—6.7%
LMArena Document—1482

Multilingual Claude Sonnet 4.6 leads

Amazon Nova Experimental Chat 26 01 10: 50.2 (#126), Claude Sonnet 4.6: 54.4 (#41)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Claude Sonnet 4.6
LMArena Non-English13811440
LMArena Chinese13721491
LMArena Russian13911440
LMArena Spanish13901464
LMArena French—1465
LMArena German—1428
LMArena Japanese—1420
LMArena Korean—1411

Instruction Following Claude Sonnet 4.6 leads

Amazon Nova Experimental Chat 26 01 10: 72.9 (#126), Claude Sonnet 4.6: 77.4 (#25)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Claude Sonnet 4.6
LMArena Instruction Following13811475

Long Context Claude Sonnet 4.6 leads

Amazon Nova Experimental Chat 26 01 10: 42.7 (#119), Claude Sonnet 4.6: 45.3 (#44)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Claude Sonnet 4.6
LMArena Longer Query14001479

Writing & Preference Claude Sonnet 4.6 leads

Amazon Nova Experimental Chat 26 01 10: 57.4 (#129), Claude Sonnet 4.6: 70.2 (#22)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Claude Sonnet 4.6
LMArena Text13961458
LMArena Creative Writing13311435
LMArena Multi-Turn13801464
EQ-Bench Creative Writing—1810
EQ-Bench 4—1207

Frequently asked questions

Is Amazon Nova Experimental Chat 26 01 10 better than Claude Sonnet 4.6?

Claude Sonnet 4.6 is the stronger model overall, scoring 50.3 to 42.8 on the Noometry Index.

Is Amazon Nova Experimental Chat 26 01 10 or Claude Sonnet 4.6 better for coding?

Claude Sonnet 4.6 scores higher on coding benchmarks: 46.3 versus 42.7 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 26 01 10 and Claude Sonnet 4.6 share?

13 benchmarks have published results for both models. Amazon Nova Experimental Chat 26 01 10 has 13 scored results on Noometry and Claude Sonnet 4.6 has 57.

Related comparisons

Go deeper