Model comparison

Amazon Nova Experimental Chat 10 20 vs Claude Opus 4.1

Amazon Nova Experimental Chat 10 20 is the stronger model overall, scoring 42.1 to 41.0 on the Noometry Index.

Last verified . 17 shared benchmarks.

Claude Opus 4.1 Anthropic

41.0

Rank #142 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Amazon Nova Experimental Chat 10 20 scores higher in 1 category and Claude Opus 4.1 in 7 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Amazon Nova Experimental Chat 10 20 leads 39.0 to 22.3.

Side by side

Amazon Nova Experimental Chat 10 20 and Claude Opus 4.1 specifications
Amazon Nova Experimental Chat 10 20Claude Opus 4.1
ProviderAmazonAnthropic
Noometry Index42.141.0
Released—2025-08-05
WeightsProprietaryProprietary
Context window—200K
Max output—32K
Input $ / M tokens—$15
Output $ / M tokens—$75
Results tracked1748

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Opus 4.1 leads

Amazon Nova Experimental Chat 10 20: 41.6 (#123), Claude Opus 4.1: 44.4 (#73)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.1
LMArena Coding14121479
SWE-bench Verified—73.3%
LMArena WebDev—1390
WeirdML—45.9%
ALE-Bench—674.77
AlgoTune—1.34

Agentic & Tool Use Not comparable

Amazon Nova Experimental Chat 10 20: —, Claude Opus 4.1: 35.0 (#41)

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.1
Terminal-Bench—38%
GDPval—43.6%
Cybench—42%
DeepResearch Bench—48.3%
LMArena Search—1148
METR Time Horizons—66.8%

Reasoning Claude Opus 4.1 leads

Amazon Nova Experimental Chat 10 20: 28.4 (#106), Claude Opus 4.1: 32.2 (#76)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.1
LMArena Hard Prompts13961443
SimpleBench—60%
Chess Puzzles—7%
EnigmaEval—7.2%
EBR-Bench—7.9%
Mystery Game Puzzles—21%
DTBench—80%
LMCA—37.1%
Epoch Capabilities Index—144.12
ForecastBench—62

Math Amazon Nova Experimental Chat 10 20 leads

Amazon Nova Experimental Chat 10 20: 39.0 (#119), Claude Opus 4.1: 22.3 (#277)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.1
LMArena Math14251431
FrontierMath (Tiers 1-3)—12.6%
FrontierMath Tier 4—2.4%
OTIS Mock AIME 2024-2025—68.9%
FrontierMath (Feb 2025 set)—7.2%
FrontierMath Tier 4 (v1)—4.2%

Knowledge Claude Opus 4.1 leads

Amazon Nova Experimental Chat 10 20: 38.5 (#144), Claude Opus 4.1: 42.0 (#101)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.1
LMArena Expert13861439
GPQA Diamond—77.3%
Humanity's Last Exam—11.5%
Confabulations—17.1%
Vectara Hallucination Rate—11.8%

Multimodal Not comparable

Amazon Nova Experimental Chat 10 20: —, Claude Opus 4.1: 26.8 (#119)

Multimodal benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.1
VPCT—35%

Multilingual Claude Opus 4.1 leads

Amazon Nova Experimental Chat 10 20: 49.5 (#131), Claude Opus 4.1: 52.0 (#95)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.1
LMArena Non-English13721405
LMArena Chinese14041427
LMArena French14251431
LMArena German13911413
LMArena Japanese13601378
LMArena Korean13241380
LMArena Russian13711422
LMArena Spanish13821448

Instruction Following Claude Opus 4.1 leads

Amazon Nova Experimental Chat 10 20: 72.1 (#141), Claude Opus 4.1: 75.6 (#58)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.1
LMArena Instruction Following13651435

Long Context Claude Opus 4.1 leads

Amazon Nova Experimental Chat 10 20: 41.7 (#133), Claude Opus 4.1: 44.5 (#63)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.1
LMArena Longer Query13701455

Writing & Preference Claude Opus 4.1 leads

Amazon Nova Experimental Chat 10 20: 56.6 (#136), Claude Opus 4.1: 62.4 (#74)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Claude Opus 4.1
LMArena Text13941419
LMArena Creative Writing13181412
LMArena Multi-Turn13641444
Short-Story Creative Writing—84.7%

Frequently asked questions

Is Amazon Nova Experimental Chat 10 20 better than Claude Opus 4.1?

Amazon Nova Experimental Chat 10 20 is the stronger model overall, scoring 42.1 to 41.0 on the Noometry Index.

Is Amazon Nova Experimental Chat 10 20 or Claude Opus 4.1 better for coding?

Claude Opus 4.1 scores higher on coding benchmarks: 44.4 versus 41.6 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 10 20 and Claude Opus 4.1 share?

17 benchmarks have published results for both models. Amazon Nova Experimental Chat 10 20 has 17 scored results on Noometry and Claude Opus 4.1 has 48.

Related comparisons

Go deeper