Model comparison

Amazon Nova Experimental Chat 10 09 vs Grok 4.1

Amazon Nova Experimental Chat 10 09 and Grok 4.1 score almost the same on the Noometry Index (41.9 vs 41.5), so choose on price, context window or the category you care about most.

Last verified . 9 shared benchmarks.

Grok 4.1 xAI

41.5

Rank #134 Confirmed

Summary

  • They share 9 benchmarks with published results for both. Amazon Nova Experimental Chat 10 09 scores higher in 1 category and Grok 4.1 in 5 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Grok 4.1 leads 62.4 to 54.7.

Side by side

Amazon Nova Experimental Chat 10 09 and Grok 4.1 specifications
Amazon Nova Experimental Chat 10 09Grok 4.1
ProviderAmazonxAI
Noometry Index41.941.5
Released—2025-11-17
WeightsProprietaryProprietary
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked919

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Amazon Nova Experimental Chat 10 09 leads

Amazon Nova Experimental Chat 10 09: 40.2 (#145), Grok 4.1: 33.7 (#253)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Grok 4.1
LMArena Coding13701445
LMArena WebDev—1214

Agentic & Tool Use Not comparable

Amazon Nova Experimental Chat 10 09: —, Grok 4.1: 34.1 (#49)

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Grok 4.1
Cybench—39%

Reasoning Grok 4.1 leads

Amazon Nova Experimental Chat 10 09: 27.3 (#120), Grok 4.1: 29.5 (#91)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Grok 4.1
LMArena Hard Prompts13561435

Math Not comparable

Amazon Nova Experimental Chat 10 09: —, Grok 4.1: 38.9 (#120)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Grok 4.1
LMArena Math—1422

Knowledge Not comparable

Amazon Nova Experimental Chat 10 09: —, Grok 4.1: 39.5 (#133)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Grok 4.1
LMArena Expert—1417

Multilingual Grok 4.1 leads

Amazon Nova Experimental Chat 10 09: 47.3 (#150), Grok 4.1: 53.4 (#68)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Grok 4.1
LMArena Non-English13401425
LMArena Chinese13411465
LMArena French—1448
LMArena German—1446
LMArena Japanese—1397
LMArena Korean—1407
LMArena Russian—1434
LMArena Spanish—1438

Instruction Following Grok 4.1 leads

Amazon Nova Experimental Chat 10 09: 69.4 (#172), Grok 4.1: 73.8 (#111)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Grok 4.1
LMArena Instruction Following13151400

Long Context Grok 4.1 leads

Amazon Nova Experimental Chat 10 09: 40.5 (#152), Grok 4.1: 43.2 (#100)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Grok 4.1
LMArena Longer Query13331416

Writing & Preference Grok 4.1 leads

Amazon Nova Experimental Chat 10 09: 54.7 (#149), Grok 4.1: 62.4 (#75)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Grok 4.1
LMArena Text13641437
LMArena Creative Writing13071411
LMArena Multi-Turn13551437

Frequently asked questions

Is Amazon Nova Experimental Chat 10 09 better than Grok 4.1?

Amazon Nova Experimental Chat 10 09 and Grok 4.1 score almost the same on the Noometry Index (41.9 vs 41.5), so choose on price, context window or the category you care about most.

Is Amazon Nova Experimental Chat 10 09 or Grok 4.1 better for coding?

Amazon Nova Experimental Chat 10 09 scores higher on coding benchmarks: 40.2 versus 33.7 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 10 09 and Grok 4.1 share?

9 benchmarks have published results for both models. Amazon Nova Experimental Chat 10 09 has 9 scored results on Noometry and Grok 4.1 has 19.

Related comparisons

Go deeper