Model comparison

Chatgpt 4o Latest 20250326 vs o3-pro

Chatgpt 4o Latest 20250326 and o3-pro score almost the same on the Noometry Index (43.8 vs 42.9), so choose on price, context window or the category you care about most.

Last verified . 2 shared benchmarks.

Chatgpt 4o Latest 20250326 OpenAI

43.8

Rank #82 Confirmed

o3-pro OpenAI

42.9

Rank #105 Confirmed

Summary

  • They share 2 benchmarks with published results for both. Chatgpt 4o Latest 20250326 scores higher in 3 categories and o3-pro in 2 categories; 5 gaps are clear of the uncertainty.
  • The widest gap is in long context, where o3-pro leads 72.2 to 43.1.

Side by side

Chatgpt 4o Latest 20250326 and o3-pro specifications
Chatgpt 4o Latest 20250326o3-pro
ProviderOpenAIOpenAI
Noometry Index43.842.9
Released—2025-06-10
WeightsProprietaryProprietary
Context window—200K
Max output—100K
Input $ / M tokens—$20
Output $ / M tokens—$80
Results tracked2112

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding o3-pro leads

Chatgpt 4o Latest 20250326: 41.6 (#122), o3-pro: 55.5 (#24)

Coding benchmarks
BenchmarkChatgpt 4o Latest 20250326o3-pro
Aider Polyglot—84.9%
WeirdML—58.2%
LMArena Coding1413—

Reasoning Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 33.8 (#71), o3-pro: 23.8 (#171)

Reasoning benchmarks
BenchmarkChatgpt 4o Latest 20250326o3-pro
Kagi LLM Benchmark75%72.1%
ARC-AGI-2—4.9%
ARC-AGI-1—59.3%
LMArena Hard Prompts1424—
DTBench—86.9%
LMCA—38.5%
Epoch Capabilities Index—147.42

Math Not comparable

Chatgpt 4o Latest 20250326: 38.6 (#134), o3-pro: —

Math benchmarks
BenchmarkChatgpt 4o Latest 20250326o3-pro
LMArena Math1407—

Knowledge Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 39.2 (#137), o3-pro: 29.5 (#238)

Knowledge benchmarks
BenchmarkChatgpt 4o Latest 20250326o3-pro
Confabulations16.6%14.2%
Vectara Hallucination Rate—23.3%
LMArena Expert1401—

Multimodal Not comparable

Chatgpt 4o Latest 20250326: 39.6 (#58), o3-pro: —

Multimodal benchmarks
BenchmarkChatgpt 4o Latest 20250326o3-pro
LMArena Vision1243—

Multilingual Not comparable

Chatgpt 4o Latest 20250326: 52.9 (#76), o3-pro: —

Multilingual benchmarks
BenchmarkChatgpt 4o Latest 20250326o3-pro
LMArena Non-English1419—
LMArena Chinese1457—
LMArena French1446—
LMArena German1423—
LMArena Japanese1405—
LMArena Korean1396—
LMArena Russian1429—
LMArena Spanish1434—

Instruction Following Not comparable

Chatgpt 4o Latest 20250326: 74.0 (#107), o3-pro: —

Instruction Following benchmarks
BenchmarkChatgpt 4o Latest 20250326o3-pro
LMArena Instruction Following1403—

Long Context o3-pro leads

Chatgpt 4o Latest 20250326: 43.1 (#107), o3-pro: 72.2 (#1)

Long Context benchmarks
BenchmarkChatgpt 4o Latest 20250326o3-pro
Fiction.LiveBench—97.2%
LMArena Longer Query1413—

Writing & Preference Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 62.6 (#72), o3-pro: 57.1 (#133)

Writing & Preference benchmarks
BenchmarkChatgpt 4o Latest 20250326o3-pro
LMArena Text1429—
LMArena Creative Writing1405—
Short-Story Creative Writing—84.4%
EQ-Bench Creative Writing1501—
LMArena Multi-Turn1454—

Frequently asked questions

Is Chatgpt 4o Latest 20250326 better than o3-pro?

Chatgpt 4o Latest 20250326 and o3-pro score almost the same on the Noometry Index (43.8 vs 42.9), so choose on price, context window or the category you care about most.

Is Chatgpt 4o Latest 20250326 or o3-pro better for coding?

o3-pro scores higher on coding benchmarks: 55.5 versus 41.6 in the Noometry coding category.

How many benchmarks do Chatgpt 4o Latest 20250326 and o3-pro share?

2 benchmarks have published results for both models. Chatgpt 4o Latest 20250326 has 21 scored results on Noometry and o3-pro has 12.

Related comparisons

Go deeper