Model comparison

Chatgpt 4o Latest 20250326 vs Claude Sonnet 5.5

Claude Sonnet 5.5 is the stronger model overall, scoring 61.9 to 43.8 on the Noometry Index.

Last verified . 13 shared benchmarks.

Chatgpt 4o Latest 20250326 OpenAI

43.8

Rank #82 Confirmed

Claude Sonnet 5.5 Anthropic

61.9

Rank #10 Confirmed

Summary

  • They share 13 benchmarks with published results for both. Chatgpt 4o Latest 20250326 scores higher in 0 categories and Claude Sonnet 5.5 in 9 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in math, where Claude Sonnet 5.5 leads 87.9 to 38.6.

Side by side

Chatgpt 4o Latest 20250326 and Claude Sonnet 5.5 specifications
Chatgpt 4o Latest 20250326Claude Sonnet 5.5
ProviderOpenAIAnthropic
Noometry Index43.861.9
Released—2026-09-28
WeightsProprietaryProprietary
Context window—1M
Max output—128K
Input $ / M tokens—$2
Output $ / M tokens—$10
Results tracked2132

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 5.5 leads

Chatgpt 4o Latest 20250326: 41.6 (#122), Claude Sonnet 5.5: 67.3 (#6)

Coding benchmarks
BenchmarkChatgpt 4o Latest 20250326Claude Sonnet 5.5
LMArena Coding14131513
FrontierCode—52.1%
CursorBench—55.5%
LMArena WebDev—1774
FrontierSWE—61.9%
SciCode—61%
ALE-Bench—1,819

Agentic & Tool Use Not comparable

Chatgpt 4o Latest 20250326: —, Claude Sonnet 5.5: 45.0 (#16)

Agentic & Tool Use benchmarks
BenchmarkChatgpt 4o Latest 20250326Claude Sonnet 5.5
APEX-Agents—75.5%

Reasoning Claude Sonnet 5.5 leads

Chatgpt 4o Latest 20250326: 33.8 (#71), Claude Sonnet 5.5: 54.0 (#28)

Reasoning benchmarks
BenchmarkChatgpt 4o Latest 20250326Claude Sonnet 5.5
LMArena Hard Prompts14241495
Kagi LLM Benchmark75%—
NYT Connections (extended)—80.5%
CritPt—31.4%
Mystery Game Puzzles—65%
Epoch Capabilities Index—165.03

Math Claude Sonnet 5.5 leads

Chatgpt 4o Latest 20250326: 38.6 (#134), Claude Sonnet 5.5: 87.9 (#6)

Math benchmarks
BenchmarkChatgpt 4o Latest 20250326Claude Sonnet 5.5
LMArena Math14071510
FrontierMath (Tiers 1-3)—88.8%
FrontierMath Tier 4—80.5%
OTIS Mock AIME 2024-2025—100%
ProofBench—100%
FrontierMath Erdős—2.9%

Knowledge Claude Sonnet 5.5 leads

Chatgpt 4o Latest 20250326: 39.2 (#137), Claude Sonnet 5.5: 66.0 (#12)

Knowledge benchmarks
BenchmarkChatgpt 4o Latest 20250326Claude Sonnet 5.5
LMArena Expert14011540
GPQA Diamond—95.6%
SimpleQA Verified—46.5%
Confabulations16.6%—

Multimodal Claude Sonnet 5.5 leads

Chatgpt 4o Latest 20250326: 39.6 (#58), Claude Sonnet 5.5: 51.5 (#6)

Multimodal benchmarks
BenchmarkChatgpt 4o Latest 20250326Claude Sonnet 5.5
LMArena Vision12431289
Furniture Assembly—75%

Multilingual Claude Sonnet 5.5 leads

Chatgpt 4o Latest 20250326: 52.9 (#76), Claude Sonnet 5.5: 55.3 (#30)

Multilingual benchmarks
BenchmarkChatgpt 4o Latest 20250326Claude Sonnet 5.5
LMArena Non-English14191452
LMArena Chinese14571522
LMArena Russian14291451
LMArena French1446—
LMArena German1423—
LMArena Japanese1405—
LMArena Korean1396—
LMArena Spanish1434—

Instruction Following Claude Sonnet 5.5 leads

Chatgpt 4o Latest 20250326: 74.0 (#107), Claude Sonnet 5.5: 78.3 (#11)

Instruction Following benchmarks
BenchmarkChatgpt 4o Latest 20250326Claude Sonnet 5.5
LMArena Instruction Following14031495

Long Context Claude Sonnet 5.5 leads

Chatgpt 4o Latest 20250326: 43.1 (#107), Claude Sonnet 5.5: 45.9 (#28)

Long Context benchmarks
BenchmarkChatgpt 4o Latest 20250326Claude Sonnet 5.5
LMArena Longer Query14131498

Writing & Preference Claude Sonnet 5.5 leads

Chatgpt 4o Latest 20250326: 62.6 (#72), Claude Sonnet 5.5: 66.0 (#40)

Writing & Preference benchmarks
BenchmarkChatgpt 4o Latest 20250326Claude Sonnet 5.5
LMArena Text14291471
LMArena Creative Writing14051465
LMArena Multi-Turn14541474
EQ-Bench Creative Writing1501—

Frequently asked questions

Is Chatgpt 4o Latest 20250326 better than Claude Sonnet 5.5?

Claude Sonnet 5.5 is the stronger model overall, scoring 61.9 to 43.8 on the Noometry Index.

Is Chatgpt 4o Latest 20250326 or Claude Sonnet 5.5 better for coding?

Claude Sonnet 5.5 scores higher on coding benchmarks: 67.3 versus 41.6 in the Noometry coding category.

How many benchmarks do Chatgpt 4o Latest 20250326 and Claude Sonnet 5.5 share?

13 benchmarks have published results for both models. Chatgpt 4o Latest 20250326 has 21 scored results on Noometry and Claude Sonnet 5.5 has 32.

Related comparisons

Go deeper