Model comparison

Claude 3.5 Haiku vs Qwen3.6 Plus

Qwen3.6 Plus is the stronger model overall, scoring 47.5 to 29.2 on the Noometry Index.

Last verified . 24 shared benchmarks.

Claude 3.5 Haiku Anthropic

29.2

Rank #315 Confirmed

Qwen3.6 Plus Alibaba (Qwen)

47.5

Rank #62 Confirmed

Summary

  • They share 24 benchmarks with published results for both. Claude 3.5 Haiku scores higher in 0 categories and Qwen3.6 Plus in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Qwen3.6 Plus leads 56.1 to 18.7.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 4.3% for Claude 3.5 Haiku and 93.3% for Qwen3.6 Plus.

Side by side

Claude 3.5 Haiku and Qwen3.6 Plus specifications
Claude 3.5 HaikuQwen3.6 Plus
ProviderAnthropicAlibaba (Qwen)
Noometry Index29.247.5
Released2024-10-222026-03-31
WeightsProprietaryProprietary
Context window—1M
Max output—66K
Input $ / M tokens—$0.50
Output $ / M tokens—$3
Results tracked4937

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Qwen3.6 Plus leads

Claude 3.5 Haiku: 32.9 (#265), Qwen3.6 Plus: 40.8 (#130)

Coding benchmarks
BenchmarkClaude 3.5 HaikuQwen3.6 Plus
SciCode27.4%40.7%
LMArena Coding12861467
SWE-bench Verified—57.9%
Aider Polyglot28%—
LMArena WebDev—1461
WeirdML30.7%—
BigCodeBench Instruct46.1%—
LiveBench Coding51.4%—
BigCodeBench Complete59%—
CadEval32%—
ALE-Bench—670.15

Agentic & Tool Use Not comparable

Claude 3.5 Haiku: 28.0 (#95), Qwen3.6 Plus: —

Agentic & Tool Use benchmarks
BenchmarkClaude 3.5 HaikuQwen3.6 Plus
BALROG19.3%—
Vending-Bench 2—5,115

Reasoning Qwen3.6 Plus leads

Claude 3.5 Haiku: 17.7 (#290), Qwen3.6 Plus: 29.3 (#93)

Reasoning benchmarks
BenchmarkClaude 3.5 HaikuQwen3.6 Plus
CritPt0%2.9%
LMArena Hard Prompts12511449
DTBench56.7%81.9%
Epoch Capabilities Index127.15147.65
NYT Connections (extended)—60.3%
Chess Puzzles—17%
Thematic Generalization—59.5%
LiveBench Reasoning28.1%—
Mystery Game Puzzles—12%
LiveBench Data Analysis48.5%—
LMCA—33.1%
LiveBench43.5%—

Math Qwen3.6 Plus leads

Claude 3.5 Haiku: 14.7 (#300), Qwen3.6 Plus: 51.8 (#54)

Math benchmarks
BenchmarkClaude 3.5 HaikuQwen3.6 Plus
OTIS Mock AIME 2024-20254.3%93.3%
LMArena Math12441450
FrontierMath (Feb 2025 set)0.3%26.2%
FrontierMath (Tiers 1-3)—38.2%
Omni-MATH22.4%—
LiveBench Math35.5%—
MATH Level 546.4%—
FrontierMath Tier 4 (v1)—8.3%

Knowledge Qwen3.6 Plus leads

Claude 3.5 Haiku: 18.7 (#281), Qwen3.6 Plus: 56.1 (#45)

Knowledge benchmarks
BenchmarkClaude 3.5 HaikuQwen3.6 Plus
GPQA Diamond38.1%88.4%
LMArena Expert12081454
SimpleQA Verified—44.1%
MMLU-Pro60.5%—
Confabulations36.7%—
GPQA (HELM)36.3%—
MMLU74.3%—

Multimodal Not comparable

Claude 3.5 Haiku: 26.8 (#117), Qwen3.6 Plus: —

Multimodal benchmarks
BenchmarkClaude 3.5 HaikuQwen3.6 Plus
LMArena Vision1092—
GeoBench34%—

Multilingual Qwen3.6 Plus leads

Claude 3.5 Haiku: 40.0 (#218), Qwen3.6 Plus: 53.3 (#70)

Multilingual benchmarks
BenchmarkClaude 3.5 HaikuQwen3.6 Plus
LMArena Non-English12381424
LMArena Chinese12291477
LMArena French12641455
LMArena German12371452
LMArena Japanese11751389
LMArena Korean11731379
LMArena Russian12531434
LMArena Spanish12611432

Instruction Following Qwen3.6 Plus leads

Claude 3.5 Haiku: 62.9 (#234), Qwen3.6 Plus: 75.0 (#74)

Instruction Following benchmarks
BenchmarkClaude 3.5 HaikuQwen3.6 Plus
LMArena Instruction Following12411425
LiveBench Instruction Following61.9%—
IFEval79.2%—

Long Context Qwen3.6 Plus leads

Claude 3.5 Haiku: 38.3 (#200), Qwen3.6 Plus: 45.2 (#49)

Long Context benchmarks
BenchmarkClaude 3.5 HaikuQwen3.6 Plus
LMArena Longer Query12611439
CL-bench—20.3%

Writing & Preference Qwen3.6 Plus leads

Claude 3.5 Haiku: 42.7 (#234), Qwen3.6 Plus: 62.2 (#82)

Writing & Preference benchmarks
BenchmarkClaude 3.5 HaikuQwen3.6 Plus
LMArena Text12551437
LMArena Creative Writing12331404
LMArena Multi-Turn12651438
Short-Story Creative Writing73.5%—
EQ-Bench Creative Writing1146—
WildBench76%—
LiveBench Language35.4%—

Frequently asked questions

Is Claude 3.5 Haiku better than Qwen3.6 Plus?

Qwen3.6 Plus is the stronger model overall, scoring 47.5 to 29.2 on the Noometry Index.

Is Claude 3.5 Haiku or Qwen3.6 Plus better for coding?

Qwen3.6 Plus scores higher on coding benchmarks: 40.8 versus 32.9 in the Noometry coding category.

How many benchmarks do Claude 3.5 Haiku and Qwen3.6 Plus share?

24 benchmarks have published results for both models. Claude 3.5 Haiku has 49 scored results on Noometry and Qwen3.6 Plus has 37.

Related comparisons

Go deeper