Model comparison

Amazon Nova Experimental Chat 26 01 10 vs Grok 4.3

Amazon Nova Experimental Chat 26 01 10 and Grok 4.3 score almost the same on the Noometry Index (42.8 vs 43.8), so choose on price, context window or the category you care about most.

Last verified . 13 shared benchmarks.

Grok 4.3 xAI

43.8

Rank #86 Confirmed

Summary

  • They share 13 benchmarks with published results for both. Amazon Nova Experimental Chat 26 01 10 scores higher in 3 categories and Grok 4.3 in 5 categories; 5 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Grok 4.3 leads 52.5 to 40.3.

Side by side

Amazon Nova Experimental Chat 26 01 10 and Grok 4.3 specifications
Amazon Nova Experimental Chat 26 01 10Grok 4.3
ProviderAmazonxAI
Noometry Index42.843.8
Released—2026-04-17
WeightsProprietaryProprietary
Context window—1M
Max output—30K
Input $ / M tokens—$1.25
Output $ / M tokens—$2.50
Results tracked1340

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Amazon Nova Experimental Chat 26 01 10 leads

Amazon Nova Experimental Chat 26 01 10: 42.7 (#96), Grok 4.3: 41.6 (#121)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Grok 4.3
LMArena Coding14471415
LMArena WebDev—1357
SciCode—47.3%
WeirdML—49.9%
ALE-Bench—944.17

Agentic & Tool Use Not comparable

Amazon Nova Experimental Chat 26 01 10: —, Grok 4.3: 27.7 (#99)

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Grok 4.3
GDP.pdf—8%
LMArena Search—1165
Vending-Bench 2—35.26

Reasoning Grok 4.3 leads

Amazon Nova Experimental Chat 26 01 10: 28.9 (#98), Grok 4.3: 35.9 (#68)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Grok 4.3
LMArena Hard Prompts14151396
NYT Connections (extended)—55.2%
CritPt—8%
Chess Puzzles—25%
DTBench—90.7%
LMCA—38.3%
Epoch Capabilities Index—149.16
ForecastBench—60.3

Math Grok 4.3 leads

Amazon Nova Experimental Chat 26 01 10: 38.5 (#136), Grok 4.3: 46.0 (#74)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Grok 4.3
LMArena Math14041388
FrontierMath (Tiers 1-3)—42.8%
FrontierMath Tier 4—14.6%
OTIS Mock AIME 2024-2025—93.3%
ProofBench—11%

Knowledge Grok 4.3 leads

Amazon Nova Experimental Chat 26 01 10: 40.3 (#120), Grok 4.3: 52.5 (#62)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Grok 4.3
LMArena Expert14441385
GPQA Diamond—88.8%
SimpleQA Verified—33.2%

Multimodal Not comparable

Amazon Nova Experimental Chat 26 01 10: —, Grok 4.3: 31.6 (#104)

Multimodal benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Grok 4.3
LMArena Vision—1229
Blueprint-Bench 2—0%

Multilingual Too close to call

Amazon Nova Experimental Chat 26 01 10: 50.2 (#126), Grok 4.3: 50.5 (#120)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Grok 4.3
LMArena Non-English13811385
LMArena Chinese13721422
LMArena Russian13911399
LMArena Spanish13901398
LMArena French—1412
LMArena German—1395
LMArena Japanese—1379
LMArena Korean—1356

Instruction Following Too close to call

Amazon Nova Experimental Chat 26 01 10: 72.9 (#126), Grok 4.3: 72.1 (#140)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Grok 4.3
LMArena Instruction Following13811366

Long Context Too close to call

Amazon Nova Experimental Chat 26 01 10: 42.7 (#119), Grok 4.3: 42.5 (#123)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Grok 4.3
LMArena Longer Query14001393

Writing & Preference Grok 4.3 leads

Amazon Nova Experimental Chat 26 01 10: 57.4 (#129), Grok 4.3: 58.5 (#118)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10Grok 4.3
LMArena Text13961397
LMArena Creative Writing13311380
LMArena Multi-Turn13801406
EQ-Bench 4—1075

Frequently asked questions

Is Amazon Nova Experimental Chat 26 01 10 better than Grok 4.3?

Amazon Nova Experimental Chat 26 01 10 and Grok 4.3 score almost the same on the Noometry Index (42.8 vs 43.8), so choose on price, context window or the category you care about most.

Is Amazon Nova Experimental Chat 26 01 10 or Grok 4.3 better for coding?

Amazon Nova Experimental Chat 26 01 10 scores higher on coding benchmarks: 42.7 versus 41.6 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 26 01 10 and Grok 4.3 share?

13 benchmarks have published results for both models. Amazon Nova Experimental Chat 26 01 10 has 13 scored results on Noometry and Grok 4.3 has 40.

Related comparisons

Go deeper