Model comparison

Claude 3 Sonnet vs Qwen Plus

Qwen Plus is the stronger model overall, scoring 37.1 to 29.0 on the Noometry Index.

Last verified . 17 shared benchmarks.

Claude 3 Sonnet Anthropic

29.0

Rank #319 Confirmed

Qwen Plus Alibaba (Qwen)

37.1

Rank #210 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Claude 3 Sonnet scores higher in 0 categories and Qwen Plus in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Qwen Plus leads 23.3 to 10.7.
  • The biggest single-benchmark swing is MATH Level 5: 18.2% for Claude 3 Sonnet and 65.3% for Qwen Plus.

Side by side

Claude 3 Sonnet and Qwen Plus specifications
Claude 3 SonnetQwen Plus
ProviderAnthropicAlibaba (Qwen)
Noometry Index29.037.1
Released2024-02-292024-01-25
WeightsProprietaryProprietary
Context window—1M
Max output—33K
Input $ / M tokens—$0.40
Output $ / M tokens—$1.20
Results tracked3020

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Qwen Plus leads

Claude 3 Sonnet: 29.6 (#302), Qwen Plus: 38.9 (#167)

Coding benchmarks
BenchmarkClaude 3 SonnetQwen Plus
LMArena Coding12231328
WeirdML10.2%—
BigCodeBench Instruct42.7%—
BigCodeBench Complete53.8%—
HumanEval+64%—
MBPP+69.3%—

Reasoning Qwen Plus leads

Claude 3 Sonnet: 20.5 (#237), Qwen Plus: 28.4 (#107)

Reasoning benchmarks
BenchmarkClaude 3 SonnetQwen Plus
LMArena Hard Prompts11971317
DTBench53.6%81.1%
Kagi LLM Benchmark—63.3%
LMCA—24%
Epoch Capabilities Index120.7—
WinoGrande75.1%—

Math Qwen Plus leads

Claude 3 Sonnet: 10.7 (#310), Qwen Plus: 23.3 (#271)

Math benchmarks
BenchmarkClaude 3 SonnetQwen Plus
OTIS Mock AIME 2024-20252.5%17.8%
LMArena Math12131326
MATH Level 518.2%65.3%
FrontierMath (Feb 2025 set)—1.7%

Knowledge Qwen Plus leads

Claude 3 Sonnet: 21.1 (#276), Qwen Plus: 27.4 (#251)

Knowledge benchmarks
BenchmarkClaude 3 SonnetQwen Plus
GPQA Diamond40.6%48.1%
LMArena Expert11731328
MMLU75.9%—

Multimodal Not comparable

Claude 3 Sonnet: 25.2 (#125), Qwen Plus: —

Multimodal benchmarks
BenchmarkClaude 3 SonnetQwen Plus
LMArena Vision984—

Multilingual Qwen Plus leads

Claude 3 Sonnet: 37.8 (#234), Qwen Plus: 45.1 (#175)

Multilingual benchmarks
BenchmarkClaude 3 SonnetQwen Plus
LMArena Non-English12051310
LMArena Chinese11891347
LMArena Japanese11311251
LMArena Russian12271323
LMArena French1229—
LMArena German1204—
LMArena Korean1128—
LMArena Spanish1204—

Instruction Following Qwen Plus leads

Claude 3 Sonnet: 62.8 (#235), Qwen Plus: 68.8 (#181)

Instruction Following benchmarks
BenchmarkClaude 3 SonnetQwen Plus
LMArena Instruction Following11991303

Long Context Qwen Plus leads

Claude 3 Sonnet: 36.7 (#228), Qwen Plus: 40.3 (#158)

Long Context benchmarks
BenchmarkClaude 3 SonnetQwen Plus
LMArena Longer Query12111324

Writing & Preference Qwen Plus leads

Claude 3 Sonnet: 42.1 (#238), Qwen Plus: 52.2 (#176)

Writing & Preference benchmarks
BenchmarkClaude 3 SonnetQwen Plus
LMArena Text12181326
LMArena Creative Writing11861293
LMArena Multi-Turn12271336

Frequently asked questions

Is Claude 3 Sonnet better than Qwen Plus?

Qwen Plus is the stronger model overall, scoring 37.1 to 29.0 on the Noometry Index.

Is Claude 3 Sonnet or Qwen Plus better for coding?

Qwen Plus scores higher on coding benchmarks: 38.9 versus 29.6 in the Noometry coding category.

How many benchmarks do Claude 3 Sonnet and Qwen Plus share?

17 benchmarks have published results for both models. Claude 3 Sonnet has 30 scored results on Noometry and Qwen Plus has 20.

Related comparisons

Go deeper