Model comparison

Amazon Nova Experimental Chat 12 10 vs GPT-4o

Amazon Nova Experimental Chat 12 10 is the stronger model overall, scoring 42.9 to 28.6 on the Noometry Index.

Last verified . 12 shared benchmarks.

GPT-4o OpenAI

28.6

Rank #324 Confirmed

Summary

  • They share 12 benchmarks with published results for both. Amazon Nova Experimental Chat 12 10 scores higher in 8 categories and GPT-4o in 0 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Amazon Nova Experimental Chat 12 10 leads 38.9 to 10.6.

Side by side

Amazon Nova Experimental Chat 12 10 and GPT-4o specifications
Amazon Nova Experimental Chat 12 10GPT-4o
ProviderAmazonOpenAI
Noometry Index42.928.6
Released—2024-05-13
WeightsProprietaryProprietary
Context window—128K
Max output—16K
Input $ / M tokens—$2.50
Output $ / M tokens—$10
Results tracked1272

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Amazon Nova Experimental Chat 12 10 leads

Amazon Nova Experimental Chat 12 10: 42.2 (#110), GPT-4o: 24.8 (#328)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10GPT-4o
LMArena Coding14301297
SWE-bench Verified—31%
SWE-bench Verified (bash only)—21.6%
Aider Polyglot—45.3%
GSO—0%
WeirdML—25.1%
BigCodeBench Instruct—51.1%
LiveBench Coding—51.4%
BigCodeBench Complete—61.1%
CadEval—26%
HumanEval+—87.2%
MBPP+—72.2%

Agentic & Tool Use Not comparable

Amazon Nova Experimental Chat 12 10: —, GPT-4o: 21.0 (#141)

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10GPT-4o
GDPval—9.9%
TheAgentCompany—8.6%
Cybench—12.5%
BALROG—32.3%
LMArena Search—1006
METR Time Horizons—40.8%

Reasoning Amazon Nova Experimental Chat 12 10 leads

Amazon Nova Experimental Chat 12 10: 29.3 (#94), GPT-4o: 9.4 (#343)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10GPT-4o
LMArena Hard Prompts14271281
ARC-AGI-2—0%
SimpleBench—17.8%
ARC-AGI-1—4.5%
CritPt—0%
Chess Puzzles—13%
EnigmaEval—0.8%
LiveBench Reasoning—55.8%
DTBench—64.5%
LiveBench Data Analysis—60.9%
LMCA—16.6%
Epoch Capabilities Index—128.97
ForecastBench—57.7
LiveBench—55.3%

Math Amazon Nova Experimental Chat 12 10 leads

Amazon Nova Experimental Chat 12 10: 38.9 (#124), GPT-4o: 10.6 (#312)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10GPT-4o
LMArena Math14191285
FrontierMath (Tiers 1-3)—0.4%
OTIS Mock AIME 2024-2025—6.4%
Omni-MATH—29.3%
LiveBench Math—49.5%
MATH Level 5—53.3%
FrontierMath (Feb 2025 set)—0.3%

Knowledge Amazon Nova Experimental Chat 12 10 leads

Amazon Nova Experimental Chat 12 10: 39.2 (#136), GPT-4o: 28.8 (#242)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10GPT-4o
LMArena Expert14081250
GPQA Diamond—49.2%
Humanity's Last Exam—2.7%
SimpleQA Verified—26%
MMLU-Pro—71.3%
Confabulations—15.3%
Vectara Hallucination Rate—9.6%
GPQA (HELM)—52%
MMLU—88.1%

Multimodal Not comparable

Amazon Nova Experimental Chat 12 10: —, GPT-4o: 34.5 (#91)

Multimodal benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10GPT-4o
LMArena Vision—1137
Video-MME—71.9%
GeoBench—71%
VPCT—40%
ScienceQA—88.5%

Multilingual Amazon Nova Experimental Chat 12 10 leads

Amazon Nova Experimental Chat 12 10: 51.4 (#108), GPT-4o: 43.2 (#186)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10GPT-4o
LMArena Non-English13981283
LMArena Chinese14401277
LMArena Russian13951286
LMArena French—1304
LMArena German—1282
LMArena Japanese—1257
LMArena Korean—1234
LMArena Spanish—1292

Instruction Following Amazon Nova Experimental Chat 12 10 leads

Amazon Nova Experimental Chat 12 10: 73.2 (#123), GPT-4o: 66.6 (#207)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10GPT-4o
LMArena Instruction Following13871278
LiveBench Instruction Following—68.6%
IFEval—81.7%

Long Context Amazon Nova Experimental Chat 12 10 leads

Amazon Nova Experimental Chat 12 10: 42.4 (#125), GPT-4o: 39.4 (#179)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10GPT-4o
LMArena Longer Query13911289
Fiction.LiveBench—66.7%

Writing & Preference Amazon Nova Experimental Chat 12 10 leads

Amazon Nova Experimental Chat 12 10: 59.5 (#110), GPT-4o: 52.6 (#166)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10GPT-4o
LMArena Text14201300
LMArena Creative Writing13501292
LMArena Multi-Turn14091302
Short-Story Creative Writing—81.8%
WildBench—82.8%
LiveBench Language—47.6%

Frequently asked questions

Is Amazon Nova Experimental Chat 12 10 better than GPT-4o?

Amazon Nova Experimental Chat 12 10 is the stronger model overall, scoring 42.9 to 28.6 on the Noometry Index.

Is Amazon Nova Experimental Chat 12 10 or GPT-4o better for coding?

Amazon Nova Experimental Chat 12 10 scores higher on coding benchmarks: 42.2 versus 24.8 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 12 10 and GPT-4o share?

12 benchmarks have published results for both models. Amazon Nova Experimental Chat 12 10 has 12 scored results on Noometry and GPT-4o has 72.

Related comparisons

Go deeper