Model comparison

Deepseek Coder v2 vs Qwen2.5 Plus 1127

Qwen2.5 Plus 1127 is the stronger model overall, scoring 38.8 to 35.9 on the Noometry Index.

Last verified . 14 shared benchmarks.

Deepseek Coder v2 DeepSeek

35.9

Rank #220 Confirmed

Qwen2.5 Plus 1127 Alibaba (Qwen)

38.8

Rank #181 Confirmed

Summary

  • They share 14 benchmarks with published results for both. Deepseek Coder v2 scores higher in 0 categories and Qwen2.5 Plus 1127 in 8 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Qwen2.5 Plus 1127 leads 49.4 to 38.2.
  • Deepseek Coder v2 has downloadable open weights; the other is API-only.

Side by side

Deepseek Coder v2 and Qwen2.5 Plus 1127 specifications
Deepseek Coder v2Qwen2.5 Plus 1127
ProviderDeepSeekAlibaba (Qwen)
Noometry Index35.938.8
Released2024-06-17—
WeightsOpenProprietary
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked2414

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

Deepseek Coder v2: 38.1 (#183), Qwen2.5 Plus 1127: 38.5 (#175)

Coding benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 Plus 1127
LMArena Coding12511314
BigCodeBench Instruct48.2%—
BigCodeBench Complete59.7%—
HumanEval+82.3%—
MBPP+75.1%—

Reasoning Qwen2.5 Plus 1127 leads

Deepseek Coder v2: 23.6 (#176), Qwen2.5 Plus 1127: 25.9 (#141)

Reasoning benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 Plus 1127
LMArena Hard Prompts12071299
WinoGrande83.7%—

Math Qwen2.5 Plus 1127 leads

Deepseek Coder v2: 34.9 (#190), Qwen2.5 Plus 1127: 36.1 (#174)

Math benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 Plus 1127
LMArena Math12411298
GSM8K94.5%—

Knowledge Qwen2.5 Plus 1127 leads

Deepseek Coder v2: 32.3 (#212), Qwen2.5 Plus 1127: 35.5 (#183)

Knowledge benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 Plus 1127
LMArena Expert11811289
ARC (AI2) Challenge64.3%—

Multilingual Qwen2.5 Plus 1127 leads

Deepseek Coder v2: 36.3 (#240), Qwen2.5 Plus 1127: 41.9 (#201)

Multilingual benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 Plus 1127
LMArena Non-English11821265
LMArena Chinese12011314
LMArena German11641231
LMArena Japanese11261207
LMArena Russian11881271
LMArena French1185—
LMArena Korean1104—
LMArena Spanish1153—

Instruction Following Qwen2.5 Plus 1127 leads

Deepseek Coder v2: 61.7 (#242), Qwen2.5 Plus 1127: 67.2 (#199)

Instruction Following benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 Plus 1127
LMArena Instruction Following11801275

Long Context Qwen2.5 Plus 1127 leads

Deepseek Coder v2: 37.0 (#224), Qwen2.5 Plus 1127: 39.2 (#184)

Long Context benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 Plus 1127
LMArena Longer Query12191292

Writing & Preference Qwen2.5 Plus 1127 leads

Deepseek Coder v2: 38.2 (#253), Qwen2.5 Plus 1127: 49.4 (#192)

Writing & Preference benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 Plus 1127
LMArena Text11911299
LMArena Creative Writing11201262
LMArena Multi-Turn11771299

Frequently asked questions

Is Deepseek Coder v2 better than Qwen2.5 Plus 1127?

Qwen2.5 Plus 1127 is the stronger model overall, scoring 38.8 to 35.9 on the Noometry Index.

Is Deepseek Coder v2 or Qwen2.5 Plus 1127 better for coding?

They score almost the same on coding (38.1 vs 38.5); test both on your own repository before choosing.

How many benchmarks do Deepseek Coder v2 and Qwen2.5 Plus 1127 share?

14 benchmarks have published results for both models. Deepseek Coder v2 has 24 scored results on Noometry and Qwen2.5 Plus 1127 has 14.

Related comparisons

Go deeper