Model comparison

Amazon Nova Experimental Chat 26 02 10 vs GPT-5.4 mini

Amazon Nova Experimental Chat 26 02 10 and GPT-5.4 mini score almost the same on the Noometry Index (44.5 vs 45.0), so choose on price, context window or the category you care about most.

Last verified . 12 shared benchmarks.

GPT-5.4 mini OpenAI

45.0

Rank #76 Confirmed

Summary

  • They share 12 benchmarks with published results for both. Amazon Nova Experimental Chat 26 02 10 scores higher in 3 categories and GPT-5.4 mini in 5 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where GPT-5.4 mini leads 51.5 to 42.3.

Side by side

Amazon Nova Experimental Chat 26 02 10 and GPT-5.4 mini specifications
Amazon Nova Experimental Chat 26 02 10GPT-5.4 mini
ProviderAmazonOpenAI
Noometry Index44.545.0
Released—2026-03-17
WeightsProprietaryProprietary
Context window—400K
Max output—128K
Input $ / M tokens—$0.75
Output $ / M tokens—$4.50
Results tracked1246

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding GPT-5.4 mini leads

Amazon Nova Experimental Chat 26 02 10: 43.9 (#82), GPT-5.4 mini: 45.2 (#72)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-5.4 mini
LMArena Coding14831438
FrontierCode—27%
LMArena WebDev—1397
SciCode—49.9%
WeirdML—60.3%
ALE-Bench—1,189

Agentic & Tool Use Not comparable

Amazon Nova Experimental Chat 26 02 10: —, GPT-5.4 mini: 29.9 (#81)

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-5.4 mini
DeepResearch Bench—36.3%

Reasoning Too close to call

Amazon Nova Experimental Chat 26 02 10: 30.1 (#86), GPT-5.4 mini: 30.4 (#85)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-5.4 mini
LMArena Hard Prompts14581424
ARC-AGI-2—18.9%
Kagi LLM Benchmark—37.9%
NYT Connections (extended)—61.8%
ARC-AGI-1—63.7%
CritPt—10%
Chess Puzzles—24%
Thematic Generalization—61.7%
Mystery Game Puzzles—11%
DTBench—80%
LMCA—40.8%
Epoch Capabilities Index—148.84
ForecastBench—57

Math GPT-5.4 mini leads

Amazon Nova Experimental Chat 26 02 10: 39.3 (#109), GPT-5.4 mini: 45.5 (#75)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-5.4 mini
LMArena Math14381419
FrontierMath (Tiers 1-3)—51.2%
FrontierMath Tier 4—9.8%
OTIS Mock AIME 2024-2025—88.9%
ProofBench—21%
FrontierMath (Feb 2025 set)—28.3%
FrontierMath Tier 4 (v1)—2.1%

Knowledge GPT-5.4 mini leads

Amazon Nova Experimental Chat 26 02 10: 42.3 (#97), GPT-5.4 mini: 51.5 (#67)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-5.4 mini
LMArena Expert15061435
GPQA Diamond—86.9%
SimpleQA Verified—29.4%
Vectara Hallucination Rate—5.5%

Multimodal Not comparable

Amazon Nova Experimental Chat 26 02 10: —, GPT-5.4 mini: 39.7 (#56)

Multimodal benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-5.4 mini
LMArena Vision—1245

Multilingual Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 54.0 (#50), GPT-5.4 mini: 51.9 (#96)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-5.4 mini
LMArena Non-English14341405
LMArena Chinese14631446
LMArena Russian14231417
LMArena French—1440
LMArena German—1409
LMArena Japanese—1374
LMArena Korean—1368
LMArena Spanish—1405

Instruction Following Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 75.2 (#69), GPT-5.4 mini: 74.1 (#102)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-5.4 mini
LMArena Instruction Following14271405

Long Context Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 44.0 (#77), GPT-5.4 mini: 43.0 (#112)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-5.4 mini
LMArena Longer Query14411407

Writing & Preference GPT-5.4 mini leads

Amazon Nova Experimental Chat 26 02 10: 61.8 (#84), GPT-5.4 mini: 64.0 (#58)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-5.4 mini
LMArena Text14481412
LMArena Creative Writing13681370
LMArena Multi-Turn14421429
EQ-Bench Creative Writing—1665

Frequently asked questions

Is Amazon Nova Experimental Chat 26 02 10 better than GPT-5.4 mini?

Amazon Nova Experimental Chat 26 02 10 and GPT-5.4 mini score almost the same on the Noometry Index (44.5 vs 45.0), so choose on price, context window or the category you care about most.

Is Amazon Nova Experimental Chat 26 02 10 or GPT-5.4 mini better for coding?

GPT-5.4 mini scores higher on coding benchmarks: 45.2 versus 43.9 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 26 02 10 and GPT-5.4 mini share?

12 benchmarks have published results for both models. Amazon Nova Experimental Chat 26 02 10 has 12 scored results on Noometry and GPT-5.4 mini has 46.

Related comparisons

Go deeper