Model comparison

Claude 3 Haiku vs Claude Opus 4.7

Claude Opus 4.7 is the stronger model overall, scoring 58.3 to 25.9 on the Noometry Index.

Last verified . 27 shared benchmarks.

Claude 3 Haiku Anthropic

25.9

Rank #340 Confirmed

Claude Opus 4.7 Anthropic

58.3

Rank #19 Confirmed

Summary

  • They share 27 benchmarks with published results for both. Claude 3 Haiku scores higher in 0 categories and Claude Opus 4.7 in 9 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in math, where Claude Opus 4.7 leads 66.7 to 9.8.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 1.8% for Claude 3 Haiku and 97.8% for Claude Opus 4.7.

Side by side

Claude 3 Haiku and Claude Opus 4.7 specifications
Claude 3 HaikuClaude Opus 4.7
ProviderAnthropicAnthropic
Noometry Index25.958.3
Released2024-03-072026-04-14
WeightsProprietaryProprietary
Context window—1M
Max output—128K
Input $ / M tokens—$5
Output $ / M tokens—$25
Results tracked3766

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Opus 4.7 leads

Claude 3 Haiku: 26.4 (#325), Claude Opus 4.7: 59.6 (#13)

Coding benchmarks
BenchmarkClaude 3 HaikuClaude Opus 4.7
WeirdML9.8%76.4%
LMArena Coding11991518
SWE-bench Verified—83.5%
FrontierCode—38.5%
LMArena WebDev—1558
SciCode—54.5%
GSO—44.1%
BigCodeBench Instruct39.4%—
MirrorCode—31.1%
BigCodeBench Complete50.1%—
CadEval12%—
ALE-Bench—1,323
HumanEval+68.9%—
MBPP+68.8%—

Agentic & Tool Use Not comparable

Claude 3 Haiku: —, Claude Opus 4.7: 47.9 (#10)

Agentic & Tool Use benchmarks
BenchmarkClaude 3 HaikuClaude Opus 4.7
Terminal-Bench—80.2%
APEX-Agents—49.2%
OSWorld 2.0—18.2%
τ²-bench Banking—40.2%
PostTrainBench—28.6%
ExploitBench—26.5%
GBAEval—43.8%
GDP.pdf—21%
LMArena Search—1233
Vending-Bench 2—10,937

Reasoning Claude Opus 4.7 leads

Claude 3 Haiku: 16.3 (#307), Claude Opus 4.7: 53.8 (#29)

Reasoning benchmarks
BenchmarkClaude 3 HaikuClaude Opus 4.7
Kagi LLM Benchmark34.2%80.7%
LMArena Hard Prompts11741506
DTBench50.1%94.7%
LMCA8.8%52.2%
Epoch Capabilities Index118.35156.25
ForecastBench53.260.3
ARC-AGI-2—75.8%
SimpleBench—61.7%
NYT Connections (extended)—39%
ARC-AGI-1—93.5%
CritPt—12%
Chess Puzzles—30%
Thematic Generalization—72.8%
EBR-Bench—19%
Mystery Game Puzzles—28%
WinoGrande74.2%—

Math Claude Opus 4.7 leads

Claude 3 Haiku: 9.8 (#319), Claude Opus 4.7: 66.7 (#26)

Knowledge Claude Opus 4.7 leads

Claude 3 Haiku: 17.3 (#285), Claude Opus 4.7: 62.6 (#23)

Knowledge benchmarks
BenchmarkClaude 3 HaikuClaude Opus 4.7
GPQA Diamond36.3%90.2%
LMArena Expert11481521
Humanity's Last Exam—36.2%
SimpleQA Verified—51.7%
Confabulations34.2%—
Vectara Hallucination Rate—12%
MMLU73.8%—

Multimodal Claude Opus 4.7 leads

Claude 3 Haiku: 23.6 (#128), Claude Opus 4.7: 41.2 (#38)

Multimodal benchmarks
BenchmarkClaude 3 HaikuClaude Opus 4.7
LMArena Vision9501316
Blueprint-Bench 2—24.5%
Furniture Assembly—33.3%
LMArena Document—1495
ScienceQA72%—

Multilingual Claude Opus 4.7 leads

Claude 3 Haiku: 36.0 (#243), Claude Opus 4.7: 57.3 (#10)

Multilingual benchmarks
BenchmarkClaude 3 HaikuClaude Opus 4.7
LMArena Non-English11781480
LMArena Chinese11551531
LMArena French11951503
LMArena German11741495
LMArena Japanese11021472
LMArena Korean11091464
LMArena Russian12041494
LMArena Spanish11661495

Instruction Following Claude Opus 4.7 leads

Claude 3 Haiku: 61.3 (#247), Claude Opus 4.7: 78.4 (#10)

Instruction Following benchmarks
BenchmarkClaude 3 HaikuClaude Opus 4.7
LMArena Instruction Following11731498

Long Context Claude Opus 4.7 leads

Claude 3 Haiku: 36.1 (#237), Claude Opus 4.7: 46.2 (#25)

Long Context benchmarks
BenchmarkClaude 3 HaikuClaude Opus 4.7
LMArena Longer Query11901505

Writing & Preference Claude Opus 4.7 leads

Claude 3 Haiku: 29.7 (#291), Claude Opus 4.7: 75.1 (#8)

Writing & Preference benchmarks
BenchmarkClaude 3 HaikuClaude Opus 4.7
LMArena Text11951490
LMArena Creative Writing11571486
EQ-Bench Creative Writing7171914
LMArena Multi-Turn11901505
EQ-Bench 4—1311

Frequently asked questions

Is Claude 3 Haiku better than Claude Opus 4.7?

Claude Opus 4.7 is the stronger model overall, scoring 58.3 to 25.9 on the Noometry Index.

Is Claude 3 Haiku or Claude Opus 4.7 better for coding?

Claude Opus 4.7 scores higher on coding benchmarks: 59.6 versus 26.4 in the Noometry coding category.

How many benchmarks do Claude 3 Haiku and Claude Opus 4.7 share?

27 benchmarks have published results for both models. Claude 3 Haiku has 37 scored results on Noometry and Claude Opus 4.7 has 66.

Related comparisons

Go deeper