Model comparison

Claude 3 Sonnet vs Qwen1.5 4b Chat

Claude 3 Sonnet and Qwen1.5 4b Chat score almost the same on the Noometry Index (29.0 vs 28.8), so choose on price, context window or the category you care about most.

Last verified . 13 shared benchmarks.

Claude 3 Sonnet Anthropic

29.0

Rank #319 Confirmed

Qwen1.5 4b Chat Alibaba (Qwen)

28.8

Rank #322 Confirmed

Summary

  • They share 13 benchmarks with published results for both. Claude 3 Sonnet scores higher in 6 categories and Qwen1.5 4b Chat in 2 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in math, where Qwen1.5 4b Chat leads 30.4 to 10.7.
  • Qwen1.5 4b Chat has downloadable open weights; the other is API-only.

Side by side

Claude 3 Sonnet and Qwen1.5 4b Chat specifications
Claude 3 SonnetQwen1.5 4b Chat
ProviderAnthropicAlibaba (Qwen)
Noometry Index29.028.8
Released2024-02-29—
WeightsProprietaryOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked3013

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

Claude 3 Sonnet: 29.6 (#302), Qwen1.5 4b Chat: 29.1 (#308)

Coding benchmarks
BenchmarkClaude 3 SonnetQwen1.5 4b Chat
LMArena Coding1223999
WeirdML10.2%—
BigCodeBench Instruct42.7%—
BigCodeBench Complete53.8%—
HumanEval+64%—
MBPP+69.3%—

Reasoning Claude 3 Sonnet leads

Claude 3 Sonnet: 20.5 (#237), Qwen1.5 4b Chat: 18.5 (#279)

Reasoning benchmarks
BenchmarkClaude 3 SonnetQwen1.5 4b Chat
LMArena Hard Prompts1197976
DTBench53.6%—
Epoch Capabilities Index120.7—
WinoGrande75.1%—

Math Qwen1.5 4b Chat leads

Claude 3 Sonnet: 10.7 (#310), Qwen1.5 4b Chat: 30.4 (#234)

Math benchmarks
BenchmarkClaude 3 SonnetQwen1.5 4b Chat
LMArena Math12131026
OTIS Mock AIME 2024-20252.5%—
MATH Level 518.2%—

Knowledge Qwen1.5 4b Chat leads

Claude 3 Sonnet: 21.1 (#276), Qwen1.5 4b Chat: 26.7 (#255)

Knowledge benchmarks
BenchmarkClaude 3 SonnetQwen1.5 4b Chat
LMArena Expert1173980
GPQA Diamond40.6%—
MMLU75.9%—

Multimodal Not comparable

Claude 3 Sonnet: 25.2 (#125), Qwen1.5 4b Chat: —

Multimodal benchmarks
BenchmarkClaude 3 SonnetQwen1.5 4b Chat
LMArena Vision984—

Multilingual Claude 3 Sonnet leads

Claude 3 Sonnet: 37.8 (#234), Qwen1.5 4b Chat: 24.1 (#290)

Multilingual benchmarks
BenchmarkClaude 3 SonnetQwen1.5 4b Chat
LMArena Non-English1205979
LMArena Chinese11891024
LMArena German1204902
LMArena Russian1227952
LMArena French1229—
LMArena Japanese1131—
LMArena Korean1128—
LMArena Spanish1204—

Instruction Following Claude 3 Sonnet leads

Claude 3 Sonnet: 62.8 (#235), Qwen1.5 4b Chat: 49.0 (#300)

Instruction Following benchmarks
BenchmarkClaude 3 SonnetQwen1.5 4b Chat
LMArena Instruction Following1199978

Long Context Claude 3 Sonnet leads

Claude 3 Sonnet: 36.7 (#228), Qwen1.5 4b Chat: 30.1 (#290)

Long Context benchmarks
BenchmarkClaude 3 SonnetQwen1.5 4b Chat
LMArena Longer Query1211988

Writing & Preference Claude 3 Sonnet leads

Claude 3 Sonnet: 42.1 (#238), Qwen1.5 4b Chat: 23.8 (#309)

Writing & Preference benchmarks
BenchmarkClaude 3 SonnetQwen1.5 4b Chat
LMArena Text1218997
LMArena Creative Writing1186969
LMArena Multi-Turn1227977

Frequently asked questions

Is Claude 3 Sonnet better than Qwen1.5 4b Chat?

Claude 3 Sonnet and Qwen1.5 4b Chat score almost the same on the Noometry Index (29.0 vs 28.8), so choose on price, context window or the category you care about most.

Is Claude 3 Sonnet or Qwen1.5 4b Chat better for coding?

They score almost the same on coding (29.6 vs 29.1); test both on your own repository before choosing.

How many benchmarks do Claude 3 Sonnet and Qwen1.5 4b Chat share?

13 benchmarks have published results for both models. Claude 3 Sonnet has 30 scored results on Noometry and Qwen1.5 4b Chat has 13.

Related comparisons

Go deeper