Model comparison

Claude Sonnet 4 vs o4-mini

Claude Sonnet 4 and o4-mini score almost the same on the Noometry Index (40.8 vs 41.6), so choose on price, context window or the category you care about most.

Last verified . 51 shared benchmarks.

Claude Sonnet 4 Anthropic

40.8

Rank #145 Confirmed

o4-mini OpenAI

41.6

Rank #132 Confirmed

Summary

  • They share 51 benchmarks with published results for both. Claude Sonnet 4 scores higher in 4 categories and o4-mini in 6 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in multimodal, where o4-mini leads 40.2 to 26.2.
  • The biggest single-benchmark swing is Fiction.LiveBench: 46.9% for Claude Sonnet 4 and 77.8% for o4-mini.
  • o4-mini is cheaper at $1.10 / $4.40 per million input/output tokens, against $3 / $15 for Claude Sonnet 4.

Side by side

Claude Sonnet 4 and o4-mini specifications
Claude Sonnet 4o4-mini
ProviderAnthropicOpenAI
Noometry Index40.841.6
Released2025-05-222025-04-16
WeightsProprietaryProprietary
Context window200K200K
Max output64K100K
Input $ / M tokens$3$1.10
Output $ / M tokens$15$4.40
Results tracked5860

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 4 leads

Claude Sonnet 4: 43.5 (#88), o4-mini: 40.9 (#127)

Coding benchmarks
BenchmarkClaude Sonnet 4o4-mini
SWE-bench Verified (bash only)64.9%45%
Aider Polyglot61.3%72%
GSO4.9%3.6%
WeirdML46.1%52.6%
LMArena Coding14141368
ALE-Bench655.35826.17
SciCode40%—
CadEval—62%
AlgoTune—1.72

Agentic & Tool Use Claude Sonnet 4 leads

Claude Sonnet 4: 38.5 (#31), o4-mini: 32.6 (#61)

Agentic & Tool Use benchmarks
BenchmarkClaude Sonnet 4o4-mini
METR Time Horizons62%63.9%
Berkeley Function Calling Leaderboard—53.2%
GDPval—25.3%
TheAgentCompany33.1%—
Cybench35%—
DeepResearch Bench46.6%—
OSWorld43.9%—

Reasoning o4-mini leads

Claude Sonnet 4: 22.9 (#187), o4-mini: 24.6 (#162)

Reasoning benchmarks
BenchmarkClaude Sonnet 4o4-mini
ARC-AGI-25.9%6.1%
SimpleBench45.5%38.7%
Kagi LLM Benchmark73%67.6%
ARC-AGI-140%58.7%
CritPt0.3%0.6%
EnigmaEval3.1%9.2%
LMArena Hard Prompts13721351
DTBench77.1%77.6%
LMCA29%26.5%
Epoch Capabilities Index141.69145.64
ForecastBench60.261.8
Chess Puzzles—26%
Mystery Game Puzzles—5%

Math Claude Sonnet 4 leads

Claude Sonnet 4: 43.3 (#80), o4-mini: 40.8 (#89)

Math benchmarks
BenchmarkClaude Sonnet 4o4-mini
OTIS Mock AIME 2024-202571.1%81.7%
Omni-MATH60.2%72%
LMArena Math13751389
MATH Level 584.4%97.8%
FrontierMath (Feb 2025 set)4.1%24.8%
FrontierMath Tier 4 (v1)0%6.3%
FrontierMath (Tiers 1-3)—36.1%
FrontierMath Tier 4—4.9%

Knowledge o4-mini leads

Claude Sonnet 4: 41.8 (#108), o4-mini: 43.6 (#91)

Knowledge benchmarks
BenchmarkClaude Sonnet 4o4-mini
GPQA Diamond79.2%79.6%
Humanity's Last Exam7.8%18.1%
MMLU-Pro84.3%82%
Confabulations13.2%15.8%
Vectara Hallucination Rate10.3%18.6%
GPQA (HELM)70.6%73.5%
LMArena Expert13721343
SimpleQA Verified—19.6%

Multimodal o4-mini leads

Claude Sonnet 4: 26.2 (#121), o4-mini: 40.2 (#49)

Multimodal benchmarks
BenchmarkClaude Sonnet 4o4-mini
LMArena Vision11911194
GeoBench37%64%
VPCT34%57.5%
MindCube44.8%—

Multilingual Too close to call

Claude Sonnet 4: 46.7 (#156), o4-mini: 47.0 (#154)

Multilingual benchmarks
BenchmarkClaude Sonnet 4o4-mini
LMArena Non-English13331337
LMArena Chinese13501354
LMArena French13631364
LMArena German13311336
LMArena Japanese13021308
LMArena Korean12911312
LMArena Russian13551334
LMArena Spanish13571347

Instruction Following o4-mini leads

Claude Sonnet 4: 71.7 (#145), o4-mini: 75.2 (#68)

Instruction Following benchmarks
BenchmarkClaude Sonnet 4o4-mini
IFEval84%92.8%
LMArena Instruction Following13761321

Long Context o4-mini leads

Claude Sonnet 4: 33.7 (#259), o4-mini: 45.5 (#33)

Long Context benchmarks
BenchmarkClaude Sonnet 4o4-mini
Fiction.LiveBench46.9%77.8%
LMArena Longer Query13981315

Writing & Preference Claude Sonnet 4 leads

Claude Sonnet 4: 57.1 (#132), o4-mini: 54.0 (#152)

Writing & Preference benchmarks
BenchmarkClaude Sonnet 4o4-mini
LMArena Text13511353
LMArena Creative Writing13451294
Short-Story Creative Writing81.4%75%
WildBench83.8%85.4%
LMArena Multi-Turn13761350
EQ-Bench Creative Writing1483—

Frequently asked questions

Is Claude Sonnet 4 better than o4-mini?

Claude Sonnet 4 and o4-mini score almost the same on the Noometry Index (40.8 vs 41.6), so choose on price, context window or the category you care about most.

Which is cheaper, Claude Sonnet 4 or o4-mini?

o4-mini is cheaper. It lists at $1.10 per million input tokens and $4.40 per million output tokens; Claude Sonnet 4 lists at $3 and $15.

Is Claude Sonnet 4 or o4-mini better for coding?

Claude Sonnet 4 scores higher on coding benchmarks: 43.5 versus 40.9 in the Noometry coding category.

Which has the bigger context window?

Both accept 200K tokens.

How many benchmarks do Claude Sonnet 4 and o4-mini share?

51 benchmarks have published results for both models. Claude Sonnet 4 has 58 scored results on Noometry and o4-mini has 60.

Related comparisons

Go deeper