Model comparison

Amazon Nova Pro vs GPT-4.1 mini

GPT-4.1 mini is the stronger model overall, scoring 33.6 to 31.0 on the Noometry Index.

Last verified . 25 shared benchmarks.

Amazon Nova Pro Amazon

31.0

Rank #281 Confirmed

GPT-4.1 mini OpenAI

33.6

Rank #240 Confirmed

Summary

  • They share 25 benchmarks with published results for both. Amazon Nova Pro scores higher in 4 categories and GPT-4.1 mini in 6 categories; 10 gaps are clear of the uncertainty.
  • The widest gap is in agentic & tool use, where GPT-4.1 mini leads 33.3 to 16.7.
  • The biggest single-benchmark swing is Berkeley Function Calling Leaderboard: 25% for Amazon Nova Pro and 50.5% for GPT-4.1 mini.
  • GPT-4.1 mini is cheaper at $0.40 / $1.60 per million input/output tokens, against $0.80 / $3.20 for Amazon Nova Pro.
  • GPT-4.1 mini accepts more context: 1.05M tokens versus 300K.

Side by side

Amazon Nova Pro and GPT-4.1 mini specifications
Amazon Nova ProGPT-4.1 mini
ProviderAmazonOpenAI
Noometry Index31.033.6
Released2024-12-032025-04-14
WeightsProprietaryProprietary
Context window300K1.05M
Max output10K33K
Input $ / M tokens$0.80$0.40
Output $ / M tokens$3.20$1.60
Results tracked3847

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Amazon Nova Pro leads

Amazon Nova Pro: 35.1 (#229), GPT-4.1 mini: 30.6 (#293)

Coding benchmarks
BenchmarkAmazon Nova ProGPT-4.1 mini
LMArena Coding12701367
SWE-bench Verified (bash only)—23.9%
Aider Polyglot—32.4%
SciCode—40.4%
WeirdML—37.6%
BigCodeBench Instruct—48.9%
LiveBench Coding38.1%—
CadEval—16%

Agentic & Tool Use GPT-4.1 mini leads

Amazon Nova Pro: 16.7 (#147), GPT-4.1 mini: 33.3 (#55)

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova ProGPT-4.1 mini
Berkeley Function Calling Leaderboard25%50.5%
TheAgentCompany1.7%—

Reasoning Amazon Nova Pro leads

Amazon Nova Pro: 20.0 (#243), GPT-4.1 mini: 10.8 (#340)

Reasoning benchmarks
BenchmarkAmazon Nova ProGPT-4.1 mini
LMArena Hard Prompts12461349
Epoch Capabilities Index123.8135.01
ARC-AGI-2—0%
Kagi LLM Benchmark—48.6%
ARC-AGI-1—3.5%
CritPt—0%
Chess Puzzles—7%
LiveBench Reasoning32.6%—
Mystery Game Puzzles—7%
DTBench—68.8%
LiveBench Data Analysis48.3%—
LMCA—21.1%
LiveBench43.5%—

Math Amazon Nova Pro leads

Amazon Nova Pro: 28.5 (#243), GPT-4.1 mini: 24.1 (#270)

Math benchmarks
BenchmarkAmazon Nova ProGPT-4.1 mini
Omni-MATH24.2%49.1%
LMArena Math12521343
FrontierMath (Tiers 1-3)—6.7%
OTIS Mock AIME 2024-2025—44.7%
LiveBench Math38%—
MATH Level 5—87.3%
FrontierMath (Feb 2025 set)—4.5%

Knowledge GPT-4.1 mini leads

Amazon Nova Pro: 27.4 (#250), GPT-4.1 mini: 34.7 (#194)

Knowledge benchmarks
BenchmarkAmazon Nova ProGPT-4.1 mini
MMLU-Pro67.3%78.3%
GPQA (HELM)44.6%61.4%
LMArena Expert12111338
GPQA Diamond—65.8%
Humanity's Last Exam4.4%—
SimpleQA Verified—12.7%
Confabulations30.1%—
Vectara Hallucination Rate5.1%—
MMLU82%—

Multimodal GPT-4.1 mini leads

Amazon Nova Pro: 25.0 (#126), GPT-4.1 mini: 35.8 (#82)

Multimodal benchmarks
BenchmarkAmazon Nova ProGPT-4.1 mini
LMArena Vision9801181

Multilingual GPT-4.1 mini leads

Amazon Nova Pro: 39.7 (#223), GPT-4.1 mini: 45.7 (#166)

Multilingual benchmarks
BenchmarkAmazon Nova ProGPT-4.1 mini
LMArena Non-English12341318
LMArena Chinese12441329
LMArena French12711358
LMArena German12431351
LMArena Japanese12001290
LMArena Korean12031298
LMArena Russian12401324
LMArena Spanish11821319

Instruction Following GPT-4.1 mini leads

Amazon Nova Pro: 64.9 (#226), GPT-4.1 mini: 73.7 (#118)

Instruction Following benchmarks
BenchmarkAmazon Nova ProGPT-4.1 mini
IFEval81.5%90.4%
LMArena Instruction Following12351333
LiveBench Instruction Following67.1%—

Long Context Amazon Nova Pro leads

Amazon Nova Pro: 38.1 (#205), GPT-4.1 mini: 31.8 (#275)

Long Context benchmarks
BenchmarkAmazon Nova ProGPT-4.1 mini
LMArena Longer Query12551344
Fiction.LiveBench—44.4%

Writing & Preference GPT-4.1 mini leads

Amazon Nova Pro: 43.9 (#226), GPT-4.1 mini: 48.6 (#199)

Writing & Preference benchmarks
BenchmarkAmazon Nova ProGPT-4.1 mini
LMArena Text12591340
LMArena Creative Writing12121300
WildBench77.7%83.8%
LMArena Multi-Turn12461354
Short-Story Creative Writing60.5%—
EQ-Bench Creative Writing—1147
LiveBench Language37%—

Frequently asked questions

Is Amazon Nova Pro better than GPT-4.1 mini?

GPT-4.1 mini is the stronger model overall, scoring 33.6 to 31.0 on the Noometry Index.

Which is cheaper, Amazon Nova Pro or GPT-4.1 mini?

GPT-4.1 mini is cheaper. It lists at $0.40 per million input tokens and $1.60 per million output tokens; Amazon Nova Pro lists at $0.80 and $3.20.

Is Amazon Nova Pro or GPT-4.1 mini better for coding?

Amazon Nova Pro scores higher on coding benchmarks: 35.1 versus 30.6 in the Noometry coding category.

Which has the bigger context window?

GPT-4.1 mini does, with 1.05M tokens against 300K.

How many benchmarks do Amazon Nova Pro and GPT-4.1 mini share?

25 benchmarks have published results for both models. Amazon Nova Pro has 38 scored results on Noometry and GPT-4.1 mini has 47.

Related comparisons

Go deeper