Model comparison

Amazon Nova Experimental Chat 11 10 vs Mercury 2

Amazon Nova Experimental Chat 11 10 is the stronger model overall, scoring 43.0 to 39.1 on the Noometry Index.

Last verified . 11 shared benchmarks.

Mercury 2 Inception

39.1

Rank #175 Confirmed

Summary

  • They share 11 benchmarks with published results for both. Amazon Nova Experimental Chat 11 10 scores higher in 7 categories and Mercury 2 in 0 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in coding, where Amazon Nova Experimental Chat 11 10 leads 42.3 to 33.5.

Side by side

Amazon Nova Experimental Chat 11 10 and Mercury 2 specifications
Amazon Nova Experimental Chat 11 10Mercury 2
ProviderAmazonInception
Noometry Index43.039.1
Released—2026-02-20
WeightsProprietaryProprietary
Context window—128K
Max output—50K
Input $ / M tokens—$0.25
Output $ / M tokens—$0.75
Results tracked1717

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Amazon Nova Experimental Chat 11 10 leads

Amazon Nova Experimental Chat 11 10: 42.3 (#107), Mercury 2: 33.5 (#255)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Mercury 2
LMArena Coding14331391
LMArena WebDev—1171
SciCode—38.7%
WeirdML—43.2%
ALE-Bench—785.58

Reasoning Amazon Nova Experimental Chat 11 10 leads

Amazon Nova Experimental Chat 11 10: 29.1 (#95), Mercury 2: 23.8 (#170)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Mercury 2
LMArena Hard Prompts14221362
CritPt—0.8%

Math Not comparable

Amazon Nova Experimental Chat 11 10: 39.1 (#114), Mercury 2: —

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Mercury 2
LMArena Math1431—

Knowledge Amazon Nova Experimental Chat 11 10 leads

Amazon Nova Experimental Chat 11 10: 39.9 (#127), Mercury 2: 36.2 (#172)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Mercury 2
LMArena Expert14311358
Vectara Hallucination Rate—12.3%

Multilingual Amazon Nova Experimental Chat 11 10 leads

Amazon Nova Experimental Chat 11 10: 51.9 (#98), Mercury 2: 46.6 (#157)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Mercury 2
LMArena Non-English14051331
LMArena Chinese14631417
LMArena Russian13941304
LMArena French1449—
LMArena German1395—
LMArena Japanese1383—
LMArena Korean1384—
LMArena Spanish1444—

Instruction Following Amazon Nova Experimental Chat 11 10 leads

Amazon Nova Experimental Chat 11 10: 73.2 (#122), Mercury 2: 70.2 (#165)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Mercury 2
LMArena Instruction Following13871329

Long Context Amazon Nova Experimental Chat 11 10 leads

Amazon Nova Experimental Chat 11 10: 42.5 (#121), Mercury 2: 40.5 (#154)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Mercury 2
LMArena Longer Query13951330

Writing & Preference Amazon Nova Experimental Chat 11 10 leads

Amazon Nova Experimental Chat 11 10: 58.8 (#114), Mercury 2: 53.8 (#155)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Mercury 2
LMArena Text14151355
LMArena Creative Writing13491289
LMArena Multi-Turn13801358

Frequently asked questions

Is Amazon Nova Experimental Chat 11 10 better than Mercury 2?

Amazon Nova Experimental Chat 11 10 is the stronger model overall, scoring 43.0 to 39.1 on the Noometry Index.

Is Amazon Nova Experimental Chat 11 10 or Mercury 2 better for coding?

Amazon Nova Experimental Chat 11 10 scores higher on coding benchmarks: 42.3 versus 33.5 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 11 10 and Mercury 2 share?

11 benchmarks have published results for both models. Amazon Nova Experimental Chat 11 10 has 17 scored results on Noometry and Mercury 2 has 17.

Related comparisons

Go deeper