Model comparison

Amazon Nova Experimental Chat 26 02 10 vs GPT-4.5

Amazon Nova Experimental Chat 26 02 10 is the stronger model overall, scoring 44.5 to 37.2 on the Noometry Index.

Last verified . 12 shared benchmarks.

GPT-4.5 OpenAI

37.2

Rank #208 Confirmed

Summary

  • They share 12 benchmarks with published results for both. Amazon Nova Experimental Chat 26 02 10 scores higher in 8 categories and GPT-4.5 in 0 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Amazon Nova Experimental Chat 26 02 10 leads 30.1 to 13.9.

Side by side

Amazon Nova Experimental Chat 26 02 10 and GPT-4.5 specifications
Amazon Nova Experimental Chat 26 02 10GPT-4.5
ProviderAmazonOpenAI
Noometry Index44.537.2
Released—2025-02-27
WeightsProprietaryProprietary
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1242

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 43.9 (#82), GPT-4.5: 42.2 (#109)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-4.5
LMArena Coding14831396
Aider Polyglot—44.9%
WeirdML—39.4%
LiveBench Coding—75.2%

Agentic & Tool Use Not comparable

Amazon Nova Experimental Chat 26 02 10: —, GPT-4.5: 27.9 (#97)

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-4.5
Cybench—17.5%

Reasoning Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 30.1 (#86), GPT-4.5: 13.9 (#330)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-4.5
LMArena Hard Prompts14581403
ARC-AGI-2—0.8%
SimpleBench—34.5%
ARC-AGI-1—10.3%
EnigmaEval—3.2%
LiveBench Reasoning—71.1%
LiveBench Data Analysis—64.3%
Epoch Capabilities Index—136.74
ForecastBench—61.7
LiveBench—69%

Math Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 39.3 (#109), GPT-4.5: 32.6 (#211)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-4.5
LMArena Math14381412
OTIS Mock AIME 2024-2025—37.8%
LiveBench Math—69.3%
MATH Level 5—78.6%

Knowledge Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 42.3 (#97), GPT-4.5: 32.5 (#211)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-4.5
LMArena Expert15061394
GPQA Diamond—68.7%
Humanity's Last Exam—5.4%
Confabulations—13.6%

Multimodal Not comparable

Amazon Nova Experimental Chat 26 02 10: —, GPT-4.5: 37.6 (#71)

Multimodal benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-4.5
LMArena Vision—1195
VPCT—45%

Multilingual Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 54.0 (#50), GPT-4.5: 52.5 (#83)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-4.5
LMArena Non-English14341413
LMArena Chinese14631421
LMArena Russian14231419
LMArena French—1418
LMArena German—1457
LMArena Japanese—1416
LMArena Korean—1392

Instruction Following Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 75.2 (#69), GPT-4.5: 72.6 (#134)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-4.5
LMArena Instruction Following14271404
LiveBench Instruction Following—72.3%

Long Context Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 44.0 (#77), GPT-4.5: 40.4 (#155)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-4.5
LMArena Longer Query14411406
Fiction.LiveBench—63.9%

Writing & Preference Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 61.8 (#84), GPT-4.5: 56.9 (#134)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10GPT-4.5
LMArena Text14481417
LMArena Creative Writing13681394
LMArena Multi-Turn14421444
Short-Story Creative Writing—75.6%
EQ-Bench Creative Writing—1258
LiveBench Language—61.5%

Frequently asked questions

Is Amazon Nova Experimental Chat 26 02 10 better than GPT-4.5?

Amazon Nova Experimental Chat 26 02 10 is the stronger model overall, scoring 44.5 to 37.2 on the Noometry Index.

Is Amazon Nova Experimental Chat 26 02 10 or GPT-4.5 better for coding?

Amazon Nova Experimental Chat 26 02 10 scores higher on coding benchmarks: 43.9 versus 42.2 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 26 02 10 and GPT-4.5 share?

12 benchmarks have published results for both models. Amazon Nova Experimental Chat 26 02 10 has 12 scored results on Noometry and GPT-4.5 has 42.

Related comparisons

Go deeper