Model comparison

Claude Haiku 4.5 vs Qwen Max

Claude Haiku 4.5 is the stronger model overall, scoring 39.5 to 34.7 on the Noometry Index.

Last verified . 21 shared benchmarks.

Claude Haiku 4.5 Anthropic

39.5

Rank #165 Confirmed

Qwen Max Alibaba (Qwen)

34.7

Rank #230 Confirmed

Summary

  • They share 21 benchmarks with published results for both. Claude Haiku 4.5 scores higher in 7 categories and Qwen Max in 1 category; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Claude Haiku 4.5 leads 44.9 to 22.3.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 66.7% for Claude Haiku 4.5 and 16.1% for Qwen Max.
  • Claude Haiku 4.5 is cheaper at $1 / $5 per million input/output tokens, against $1.60 / $6.40 for Qwen Max.
  • Claude Haiku 4.5 accepts more context: 200K tokens versus 33K.

Side by side

Claude Haiku 4.5 and Qwen Max specifications
Claude Haiku 4.5Qwen Max
ProviderAnthropicAlibaba (Qwen)
Noometry Index39.534.7
Released2025-10-152024-04-03
WeightsProprietaryProprietary
Context window200K33K
Max output64K8K
Input $ / M tokens$1$1.60
Output $ / M tokens$5$6.40
Results tracked5323

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Haiku 4.5 leads

Claude Haiku 4.5: 44.0 (#78), Qwen Max: 30.7 (#292)

Coding benchmarks
BenchmarkClaude Haiku 4.5Qwen Max
LMArena Coding14531288
SWE-bench Verified (bash only)66.6%—
Aider Polyglot—21.8%
LMArena WebDev1330—
SWE-bench Multilingual64.7%—
SciCode43.3%—
WeirdML45.4%—
ALE-Bench653.48—

Agentic & Tool Use Not comparable

Claude Haiku 4.5: 33.6 (#52), Qwen Max: —

Agentic & Tool Use benchmarks
BenchmarkClaude Haiku 4.5Qwen Max
Terminal-Bench35.5%—
Berkeley Function Calling Leaderboard68.7%—
DeepResearch Bench45.5%—
BALROG31.2%—
ExploitBench13.7%—
Vending-Bench 2458.89—

Reasoning Qwen Max leads

Claude Haiku 4.5: 15.1 (#320), Qwen Max: 25.1 (#151)

Reasoning benchmarks
BenchmarkClaude Haiku 4.5Qwen Max
LMArena Hard Prompts14201269
ARC-AGI-24%—
NYT Connections (extended)14.3%—
ARC-AGI-147.7%—
CritPt0%—
Chess Puzzles8%—
DTBench73.6%—
LMCA30.9%—
Epoch Capabilities Index142.41—
ForecastBench61.4—

Math Claude Haiku 4.5 leads

Claude Haiku 4.5: 44.9 (#78), Qwen Max: 22.3 (#276)

Math benchmarks
BenchmarkClaude Haiku 4.5Qwen Max
OTIS Mock AIME 2024-202566.7%16.1%
LMArena Math13961275
MATH Level 596.4%67.2%
FrontierMath (Feb 2025 set)5.9%1%
Omni-MATH56.1%—
FrontierMath Tier 4 (v1)2.1%—

Knowledge Claude Haiku 4.5 leads

Claude Haiku 4.5: 37.7 (#153), Qwen Max: 30.3 (#228)

Knowledge benchmarks
BenchmarkClaude Haiku 4.5Qwen Max
GPQA Diamond71.2%56.1%
LMArena Expert14421248
SimpleQA Verified13.2%—
MMLU-Pro77.7%—
Vectara Hallucination Rate9.8%—
GPQA (HELM)60.5%—

Multimodal Not comparable

Claude Haiku 4.5: 26.8 (#118), Qwen Max: —

Multimodal benchmarks
BenchmarkClaude Haiku 4.5Qwen Max
Blueprint-Bench 20%—
LMArena Document1420—

Multilingual Claude Haiku 4.5 leads

Claude Haiku 4.5: 49.9 (#129), Qwen Max: 41.8 (#202)

Multilingual benchmarks
BenchmarkClaude Haiku 4.5Qwen Max
LMArena Non-English13771263
LMArena Chinese14171254
LMArena French14081330
LMArena German13751254
LMArena Japanese13391205
LMArena Korean13471142
LMArena Russian13811274
LMArena Spanish14201290

Instruction Following Claude Haiku 4.5 leads

Claude Haiku 4.5: 71.4 (#149), Qwen Max: 66.5 (#208)

Instruction Following benchmarks
BenchmarkClaude Haiku 4.5Qwen Max
LMArena Instruction Following14141262
IFEval80.1%—

Long Context Claude Haiku 4.5 leads

Claude Haiku 4.5: 43.6 (#92), Qwen Max: 39.4 (#180)

Long Context benchmarks
BenchmarkClaude Haiku 4.5Qwen Max
LMArena Longer Query14271288
Fiction.LiveBench—66.7%

Writing & Preference Claude Haiku 4.5 leads

Claude Haiku 4.5: 57.9 (#123), Qwen Max: 47.8 (#205)

Writing & Preference benchmarks
BenchmarkClaude Haiku 4.5Qwen Max
LMArena Text13961282
LMArena Creative Writing13721248
LMArena Multi-Turn14091277
WildBench83.9%—
EQ-Bench 41064—

Frequently asked questions

Is Claude Haiku 4.5 better than Qwen Max?

Claude Haiku 4.5 is the stronger model overall, scoring 39.5 to 34.7 on the Noometry Index.

Which is cheaper, Claude Haiku 4.5 or Qwen Max?

Claude Haiku 4.5 is cheaper. It lists at $1 per million input tokens and $5 per million output tokens; Qwen Max lists at $1.60 and $6.40.

Is Claude Haiku 4.5 or Qwen Max better for coding?

Claude Haiku 4.5 scores higher on coding benchmarks: 44.0 versus 30.7 in the Noometry coding category.

Which has the bigger context window?

Claude Haiku 4.5 does, with 200K tokens against 33K.

How many benchmarks do Claude Haiku 4.5 and Qwen Max share?

21 benchmarks have published results for both models. Claude Haiku 4.5 has 53 scored results on Noometry and Qwen Max has 23.

Related comparisons

Go deeper