Model comparison

Claude 3.5 Haiku vs GPT-4.1 mini

GPT-4.1 mini is the stronger model overall, scoring 33.6 to 29.2 on the Noometry Index.

Last verified . 36 shared benchmarks.

Claude 3.5 Haiku Anthropic

29.2

Rank #315 Confirmed

GPT-4.1 mini OpenAI

33.6

Rank #240 Confirmed

Summary

  • They share 36 benchmarks with published results for both. Claude 3.5 Haiku scores higher in 3 categories and GPT-4.1 mini in 7 categories; 10 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where GPT-4.1 mini leads 34.7 to 18.7.
  • The biggest single-benchmark swing is MATH Level 5: 46.4% for Claude 3.5 Haiku and 87.3% for GPT-4.1 mini.

Side by side

Claude 3.5 Haiku and GPT-4.1 mini specifications
Claude 3.5 HaikuGPT-4.1 mini
ProviderAnthropicOpenAI
Noometry Index29.233.6
Released2024-10-222025-04-14
WeightsProprietaryProprietary
Context window—1.05M
Max output—33K
Input $ / M tokens—$0.40
Output $ / M tokens—$1.60
Results tracked4947

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude 3.5 Haiku leads

Claude 3.5 Haiku: 32.9 (#265), GPT-4.1 mini: 30.6 (#293)

Coding benchmarks
BenchmarkClaude 3.5 HaikuGPT-4.1 mini
Aider Polyglot28%32.4%
SciCode27.4%40.4%
WeirdML30.7%37.6%
BigCodeBench Instruct46.1%48.9%
LMArena Coding12861367
CadEval32%16%
SWE-bench Verified (bash only)—23.9%
LiveBench Coding51.4%—
BigCodeBench Complete59%—

Agentic & Tool Use GPT-4.1 mini leads

Claude 3.5 Haiku: 28.0 (#95), GPT-4.1 mini: 33.3 (#55)

Agentic & Tool Use benchmarks
BenchmarkClaude 3.5 HaikuGPT-4.1 mini
Berkeley Function Calling Leaderboard—50.5%
BALROG19.3%—

Reasoning Claude 3.5 Haiku leads

Claude 3.5 Haiku: 17.7 (#290), GPT-4.1 mini: 10.8 (#340)

Reasoning benchmarks
BenchmarkClaude 3.5 HaikuGPT-4.1 mini
CritPt0%0%
LMArena Hard Prompts12511349
DTBench56.7%68.8%
Epoch Capabilities Index127.15135.01
ARC-AGI-2—0%
Kagi LLM Benchmark—48.6%
ARC-AGI-1—3.5%
Chess Puzzles—7%
LiveBench Reasoning28.1%—
Mystery Game Puzzles—7%
LiveBench Data Analysis48.5%—
LMCA—21.1%
LiveBench43.5%—

Math GPT-4.1 mini leads

Claude 3.5 Haiku: 14.7 (#300), GPT-4.1 mini: 24.1 (#270)

Math benchmarks
BenchmarkClaude 3.5 HaikuGPT-4.1 mini
OTIS Mock AIME 2024-20254.3%44.7%
Omni-MATH22.4%49.1%
LMArena Math12441343
MATH Level 546.4%87.3%
FrontierMath (Feb 2025 set)0.3%4.5%
FrontierMath (Tiers 1-3)—6.7%
LiveBench Math35.5%—

Knowledge GPT-4.1 mini leads

Claude 3.5 Haiku: 18.7 (#281), GPT-4.1 mini: 34.7 (#194)

Knowledge benchmarks
BenchmarkClaude 3.5 HaikuGPT-4.1 mini
GPQA Diamond38.1%65.8%
MMLU-Pro60.5%78.3%
GPQA (HELM)36.3%61.4%
LMArena Expert12081338
SimpleQA Verified—12.7%
Confabulations36.7%—
MMLU74.3%—

Multimodal GPT-4.1 mini leads

Claude 3.5 Haiku: 26.8 (#117), GPT-4.1 mini: 35.8 (#82)

Multimodal benchmarks
BenchmarkClaude 3.5 HaikuGPT-4.1 mini
LMArena Vision10921181
GeoBench34%—

Multilingual GPT-4.1 mini leads

Claude 3.5 Haiku: 40.0 (#218), GPT-4.1 mini: 45.7 (#166)

Multilingual benchmarks
BenchmarkClaude 3.5 HaikuGPT-4.1 mini
LMArena Non-English12381318
LMArena Chinese12291329
LMArena French12641358
LMArena German12371351
LMArena Japanese11751290
LMArena Korean11731298
LMArena Russian12531324
LMArena Spanish12611319

Instruction Following GPT-4.1 mini leads

Claude 3.5 Haiku: 62.9 (#234), GPT-4.1 mini: 73.7 (#118)

Instruction Following benchmarks
BenchmarkClaude 3.5 HaikuGPT-4.1 mini
IFEval79.2%90.4%
LMArena Instruction Following12411333
LiveBench Instruction Following61.9%—

Long Context Claude 3.5 Haiku leads

Claude 3.5 Haiku: 38.3 (#200), GPT-4.1 mini: 31.8 (#275)

Long Context benchmarks
BenchmarkClaude 3.5 HaikuGPT-4.1 mini
LMArena Longer Query12611344
Fiction.LiveBench—44.4%

Writing & Preference GPT-4.1 mini leads

Claude 3.5 Haiku: 42.7 (#234), GPT-4.1 mini: 48.6 (#199)

Writing & Preference benchmarks
BenchmarkClaude 3.5 HaikuGPT-4.1 mini
LMArena Text12551340
LMArena Creative Writing12331300
EQ-Bench Creative Writing11461147
WildBench76%83.8%
LMArena Multi-Turn12651354
Short-Story Creative Writing73.5%—
LiveBench Language35.4%—

Frequently asked questions

Is Claude 3.5 Haiku better than GPT-4.1 mini?

GPT-4.1 mini is the stronger model overall, scoring 33.6 to 29.2 on the Noometry Index.

Is Claude 3.5 Haiku or GPT-4.1 mini better for coding?

Claude 3.5 Haiku scores higher on coding benchmarks: 32.9 versus 30.6 in the Noometry coding category.

How many benchmarks do Claude 3.5 Haiku and GPT-4.1 mini share?

36 benchmarks have published results for both models. Claude 3.5 Haiku has 49 scored results on Noometry and GPT-4.1 mini has 47.

Related comparisons

Go deeper