Model comparison

Claude 3.5 Haiku vs Qwen Plus

Qwen Plus is the stronger model overall, scoring 37.1 to 29.2 on the Noometry Index.

Last verified . 18 shared benchmarks.

Claude 3.5 Haiku Anthropic

29.2

Rank #315 Confirmed

Qwen Plus Alibaba (Qwen)

37.1

Rank #210 Confirmed

Summary

  • They share 18 benchmarks with published results for both. Claude 3.5 Haiku scores higher in 0 categories and Qwen Plus in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Qwen Plus leads 28.4 to 17.7.
  • The biggest single-benchmark swing is DTBench: 56.7% for Claude 3.5 Haiku and 81.1% for Qwen Plus.

Side by side

Claude 3.5 Haiku and Qwen Plus specifications
Claude 3.5 HaikuQwen Plus
ProviderAnthropicAlibaba (Qwen)
Noometry Index29.237.1
Released2024-10-222024-01-25
WeightsProprietaryProprietary
Context window—1M
Max output—33K
Input $ / M tokens—$0.40
Output $ / M tokens—$1.20
Results tracked4920

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Qwen Plus leads

Claude 3.5 Haiku: 32.9 (#265), Qwen Plus: 38.9 (#167)

Coding benchmarks
BenchmarkClaude 3.5 HaikuQwen Plus
LMArena Coding12861328
Aider Polyglot28%—
SciCode27.4%—
WeirdML30.7%—
BigCodeBench Instruct46.1%—
LiveBench Coding51.4%—
BigCodeBench Complete59%—
CadEval32%—

Agentic & Tool Use Not comparable

Claude 3.5 Haiku: 28.0 (#95), Qwen Plus: —

Agentic & Tool Use benchmarks
BenchmarkClaude 3.5 HaikuQwen Plus
BALROG19.3%—

Reasoning Qwen Plus leads

Claude 3.5 Haiku: 17.7 (#290), Qwen Plus: 28.4 (#107)

Reasoning benchmarks
BenchmarkClaude 3.5 HaikuQwen Plus
LMArena Hard Prompts12511317
DTBench56.7%81.1%
Kagi LLM Benchmark—63.3%
CritPt0%—
LiveBench Reasoning28.1%—
LiveBench Data Analysis48.5%—
LMCA—24%
Epoch Capabilities Index127.15—
LiveBench43.5%—

Math Qwen Plus leads

Claude 3.5 Haiku: 14.7 (#300), Qwen Plus: 23.3 (#271)

Math benchmarks
BenchmarkClaude 3.5 HaikuQwen Plus
OTIS Mock AIME 2024-20254.3%17.8%
LMArena Math12441326
MATH Level 546.4%65.3%
FrontierMath (Feb 2025 set)0.3%1.7%
Omni-MATH22.4%—
LiveBench Math35.5%—

Knowledge Qwen Plus leads

Claude 3.5 Haiku: 18.7 (#281), Qwen Plus: 27.4 (#251)

Knowledge benchmarks
BenchmarkClaude 3.5 HaikuQwen Plus
GPQA Diamond38.1%48.1%
LMArena Expert12081328
MMLU-Pro60.5%—
Confabulations36.7%—
GPQA (HELM)36.3%—
MMLU74.3%—

Multimodal Not comparable

Claude 3.5 Haiku: 26.8 (#117), Qwen Plus: —

Multimodal benchmarks
BenchmarkClaude 3.5 HaikuQwen Plus
LMArena Vision1092—
GeoBench34%—

Multilingual Qwen Plus leads

Claude 3.5 Haiku: 40.0 (#218), Qwen Plus: 45.1 (#175)

Multilingual benchmarks
BenchmarkClaude 3.5 HaikuQwen Plus
LMArena Non-English12381310
LMArena Chinese12291347
LMArena Japanese11751251
LMArena Russian12531323
LMArena French1264—
LMArena German1237—
LMArena Korean1173—
LMArena Spanish1261—

Instruction Following Qwen Plus leads

Claude 3.5 Haiku: 62.9 (#234), Qwen Plus: 68.8 (#181)

Instruction Following benchmarks
BenchmarkClaude 3.5 HaikuQwen Plus
LMArena Instruction Following12411303
LiveBench Instruction Following61.9%—
IFEval79.2%—

Long Context Qwen Plus leads

Claude 3.5 Haiku: 38.3 (#200), Qwen Plus: 40.3 (#158)

Long Context benchmarks
BenchmarkClaude 3.5 HaikuQwen Plus
LMArena Longer Query12611324

Writing & Preference Qwen Plus leads

Claude 3.5 Haiku: 42.7 (#234), Qwen Plus: 52.2 (#176)

Writing & Preference benchmarks
BenchmarkClaude 3.5 HaikuQwen Plus
LMArena Text12551326
LMArena Creative Writing12331293
LMArena Multi-Turn12651336
Short-Story Creative Writing73.5%—
EQ-Bench Creative Writing1146—
WildBench76%—
LiveBench Language35.4%—

Frequently asked questions

Is Claude 3.5 Haiku better than Qwen Plus?

Qwen Plus is the stronger model overall, scoring 37.1 to 29.2 on the Noometry Index.

Is Claude 3.5 Haiku or Qwen Plus better for coding?

Qwen Plus scores higher on coding benchmarks: 38.9 versus 32.9 in the Noometry coding category.

How many benchmarks do Claude 3.5 Haiku and Qwen Plus share?

18 benchmarks have published results for both models. Claude 3.5 Haiku has 49 scored results on Noometry and Qwen Plus has 20.

Related comparisons

Go deeper