Model comparison

Amazon Nova Experimental Chat 10 20 vs Grok 3

Amazon Nova Experimental Chat 10 20 is the stronger model overall, scoring 42.1 to 39.9 on the Noometry Index.

Last verified . 17 shared benchmarks.

Grok 3 xAI

39.9

Rank #157 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Amazon Nova Experimental Chat 10 20 scores higher in 4 categories and Grok 3 in 4 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Amazon Nova Experimental Chat 10 20 leads 28.4 to 13.7.

Side by side

Amazon Nova Experimental Chat 10 20 and Grok 3 specifications
Amazon Nova Experimental Chat 10 20Grok 3
ProviderAmazonxAI
Noometry Index42.139.9
Released—2025-04-09
WeightsProprietaryProprietary
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1740

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

Amazon Nova Experimental Chat 10 20: 41.6 (#123), Grok 3: 41.9 (#115)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Grok 3
LMArena Coding14121432
Aider Polyglot—53.3%
WeirdML—37.2%

Agentic & Tool Use Not comparable

Amazon Nova Experimental Chat 10 20: —, Grok 3: 30.5 (#76)

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Grok 3
BALROG—29.5%

Reasoning Amazon Nova Experimental Chat 10 20 leads

Amazon Nova Experimental Chat 10 20: 28.4 (#106), Grok 3: 13.7 (#333)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Grok 3
LMArena Hard Prompts13961434
ARC-AGI-2—0%
SimpleBench—36.1%
Kagi LLM Benchmark—61.3%
ARC-AGI-1—5.5%
Epoch Capabilities Index—138.33

Math Amazon Nova Experimental Chat 10 20 leads

Amazon Nova Experimental Chat 10 20: 39.0 (#119), Grok 3: 38.0 (#145)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Grok 3
LMArena Math14251391
OTIS Mock AIME 2024-2025—55.6%
Omni-MATH—46.4%
MATH Level 5—88.7%
FrontierMath (Feb 2025 set)—3.8%
FrontierMath Tier 4 (v1)—0%

Knowledge Grok 3 leads

Amazon Nova Experimental Chat 10 20: 38.5 (#144), Grok 3: 46.2 (#82)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Grok 3
LMArena Expert13861421
GPQA Diamond—75.8%
MMLU-Pro—78.8%
Confabulations—14.2%
Vectara Hallucination Rate—5.8%
GPQA (HELM)—65%

Multilingual Grok 3 leads

Amazon Nova Experimental Chat 10 20: 49.5 (#131), Grok 3: 52.3 (#87)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Grok 3
LMArena Non-English13721410
LMArena Chinese14041448
LMArena French14251460
LMArena German13911431
LMArena Japanese13601387
LMArena Korean13241373
LMArena Russian13711416
LMArena Spanish13821417

Instruction Following Grok 3 leads

Amazon Nova Experimental Chat 10 20: 72.1 (#141), Grok 3: 75.0 (#73)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Grok 3
LMArena Instruction Following13651409
IFEval—88.4%

Long Context Amazon Nova Experimental Chat 10 20 leads

Amazon Nova Experimental Chat 10 20: 41.7 (#133), Grok 3: 38.7 (#192)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Grok 3
LMArena Longer Query13701439
Fiction.LiveBench—58.3%

Writing & Preference Too close to call

Amazon Nova Experimental Chat 10 20: 56.6 (#136), Grok 3: 55.8 (#141)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20Grok 3
LMArena Text13941426
LMArena Creative Writing13181414
LMArena Multi-Turn13641425
Short-Story Creative Writing—76.4%
EQ-Bench Creative Writing—1186
WildBench—84.9%

Frequently asked questions

Is Amazon Nova Experimental Chat 10 20 better than Grok 3?

Amazon Nova Experimental Chat 10 20 is the stronger model overall, scoring 42.1 to 39.9 on the Noometry Index.

Is Amazon Nova Experimental Chat 10 20 or Grok 3 better for coding?

They score almost the same on coding (41.6 vs 41.9); test both on your own repository before choosing.

How many benchmarks do Amazon Nova Experimental Chat 10 20 and Grok 3 share?

17 benchmarks have published results for both models. Amazon Nova Experimental Chat 10 20 has 17 scored results on Noometry and Grok 3 has 40.

Related comparisons

Go deeper