Model comparison

Chatgpt 4o Latest 20250326 vs GPT-5.4 mini

GPT-5.4 mini is the stronger model overall, scoring 45.0 to 43.8 on the Noometry Index.

Last verified . 20 shared benchmarks.

Chatgpt 4o Latest 20250326 OpenAI

43.8

Rank #82 Confirmed

GPT-5.4 mini OpenAI

45.0

Rank #76 Confirmed

Summary

  • They share 20 benchmarks with published results for both. Chatgpt 4o Latest 20250326 scores higher in 3 categories and GPT-5.4 mini in 6 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where GPT-5.4 mini leads 51.5 to 39.2.
  • The biggest single-benchmark swing is Kagi LLM Benchmark: 75% for Chatgpt 4o Latest 20250326 and 37.9% for GPT-5.4 mini.

Side by side

Chatgpt 4o Latest 20250326 and GPT-5.4 mini specifications
Chatgpt 4o Latest 20250326GPT-5.4 mini
ProviderOpenAIOpenAI
Noometry Index43.845.0
Released—2026-03-17
WeightsProprietaryProprietary
Context window—400K
Max output—128K
Input $ / M tokens—$0.75
Output $ / M tokens—$4.50
Results tracked2146

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding GPT-5.4 mini leads

Chatgpt 4o Latest 20250326: 41.6 (#122), GPT-5.4 mini: 45.2 (#72)

Coding benchmarks
BenchmarkChatgpt 4o Latest 20250326GPT-5.4 mini
LMArena Coding14131438
FrontierCode—27%
LMArena WebDev—1397
SciCode—49.9%
WeirdML—60.3%
ALE-Bench—1,189

Agentic & Tool Use Not comparable

Chatgpt 4o Latest 20250326: —, GPT-5.4 mini: 29.9 (#81)

Agentic & Tool Use benchmarks
BenchmarkChatgpt 4o Latest 20250326GPT-5.4 mini
DeepResearch Bench—36.3%

Reasoning Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 33.8 (#71), GPT-5.4 mini: 30.4 (#85)

Reasoning benchmarks
BenchmarkChatgpt 4o Latest 20250326GPT-5.4 mini
Kagi LLM Benchmark75%37.9%
LMArena Hard Prompts14241424
ARC-AGI-2—18.9%
NYT Connections (extended)—61.8%
ARC-AGI-1—63.7%
CritPt—10%
Chess Puzzles—24%
Thematic Generalization—61.7%
Mystery Game Puzzles—11%
DTBench—80%
LMCA—40.8%
Epoch Capabilities Index—148.84
ForecastBench—57

Math GPT-5.4 mini leads

Chatgpt 4o Latest 20250326: 38.6 (#134), GPT-5.4 mini: 45.5 (#75)

Math benchmarks
BenchmarkChatgpt 4o Latest 20250326GPT-5.4 mini
LMArena Math14071419
FrontierMath (Tiers 1-3)—51.2%
FrontierMath Tier 4—9.8%
OTIS Mock AIME 2024-2025—88.9%
ProofBench—21%
FrontierMath (Feb 2025 set)—28.3%
FrontierMath Tier 4 (v1)—2.1%

Knowledge GPT-5.4 mini leads

Chatgpt 4o Latest 20250326: 39.2 (#137), GPT-5.4 mini: 51.5 (#67)

Knowledge benchmarks
BenchmarkChatgpt 4o Latest 20250326GPT-5.4 mini
LMArena Expert14011435
GPQA Diamond—86.9%
SimpleQA Verified—29.4%
Confabulations16.6%—
Vectara Hallucination Rate—5.5%

Multimodal Too close to call

Chatgpt 4o Latest 20250326: 39.6 (#58), GPT-5.4 mini: 39.7 (#56)

Multimodal benchmarks
BenchmarkChatgpt 4o Latest 20250326GPT-5.4 mini
LMArena Vision12431245

Multilingual Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 52.9 (#76), GPT-5.4 mini: 51.9 (#96)

Multilingual benchmarks
BenchmarkChatgpt 4o Latest 20250326GPT-5.4 mini
LMArena Non-English14191405
LMArena Chinese14571446
LMArena French14461440
LMArena German14231409
LMArena Japanese14051374
LMArena Korean13961368
LMArena Russian14291417
LMArena Spanish14341405

Instruction Following Too close to call

Chatgpt 4o Latest 20250326: 74.0 (#107), GPT-5.4 mini: 74.1 (#102)

Instruction Following benchmarks
BenchmarkChatgpt 4o Latest 20250326GPT-5.4 mini
LMArena Instruction Following14031405

Long Context Too close to call

Chatgpt 4o Latest 20250326: 43.1 (#107), GPT-5.4 mini: 43.0 (#112)

Long Context benchmarks
BenchmarkChatgpt 4o Latest 20250326GPT-5.4 mini
LMArena Longer Query14131407

Writing & Preference GPT-5.4 mini leads

Chatgpt 4o Latest 20250326: 62.6 (#72), GPT-5.4 mini: 64.0 (#58)

Writing & Preference benchmarks
BenchmarkChatgpt 4o Latest 20250326GPT-5.4 mini
LMArena Text14291412
LMArena Creative Writing14051370
EQ-Bench Creative Writing15011665
LMArena Multi-Turn14541429

Frequently asked questions

Is Chatgpt 4o Latest 20250326 better than GPT-5.4 mini?

GPT-5.4 mini is the stronger model overall, scoring 45.0 to 43.8 on the Noometry Index.

Is Chatgpt 4o Latest 20250326 or GPT-5.4 mini better for coding?

GPT-5.4 mini scores higher on coding benchmarks: 45.2 versus 41.6 in the Noometry coding category.

How many benchmarks do Chatgpt 4o Latest 20250326 and GPT-5.4 mini share?

20 benchmarks have published results for both models. Chatgpt 4o Latest 20250326 has 21 scored results on Noometry and GPT-5.4 mini has 46.

Related comparisons

Go deeper