Model comparison

Deepseek Coder v2 vs Qwen2.5 32B Instruct

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 30.1 on the Noometry Index.

Last verified . 2 shared benchmarks.

Deepseek Coder v2 DeepSeek

35.9

Rank #220 Confirmed

Qwen2.5 32B Instruct Alibaba (Qwen)

30.1

Rank #297 Confirmed

Summary

  • They share 2 benchmarks with published results for both. Deepseek Coder v2 scores higher in 3 categories and Qwen2.5 32B Instruct in 1 category; 3 gaps are clear of the uncertainty.
  • The widest gap is in math, where Deepseek Coder v2 leads 34.9 to 16.2.
  • The biggest single-benchmark swing is BigCodeBench Complete: 59.7% for Deepseek Coder v2 and 52.3% for Qwen2.5 32B Instruct.

Side by side

Deepseek Coder v2 and Qwen2.5 32B Instruct specifications
Deepseek Coder v2Qwen2.5 32B Instruct
ProviderDeepSeekAlibaba (Qwen)
Noometry Index35.930.1
Released2024-06-172024-09
WeightsOpenOpen
Context window—131K
Max output—8K
Input $ / M tokens—$0.70
Output $ / M tokens—$2.80
Results tracked247

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

Deepseek Coder v2: 38.1 (#183), Qwen2.5 32B Instruct: 38.7 (#169)

Coding benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 32B Instruct
BigCodeBench Instruct48.2%45%
BigCodeBench Complete59.7%52.3%
LMArena Coding1251—
HumanEval+82.3%—
MBPP+75.1%—

Reasoning Deepseek Coder v2 leads

Deepseek Coder v2: 23.6 (#176), Qwen2.5 32B Instruct: 19.2 (#266)

Reasoning benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 32B Instruct
Chess Puzzles—0%
LMArena Hard Prompts1207—
Epoch Capabilities Index—128.52
WinoGrande83.7%—

Math Deepseek Coder v2 leads

Deepseek Coder v2: 34.9 (#190), Qwen2.5 32B Instruct: 16.2 (#296)

Math benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 32B Instruct
OTIS Mock AIME 2024-2025—7.4%
LMArena Math1241—
MATH Level 5—56.1%
GSM8K94.5%—

Knowledge Deepseek Coder v2 leads

Deepseek Coder v2: 32.3 (#212), Qwen2.5 32B Instruct: 24.9 (#266)

Knowledge benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 32B Instruct
GPQA Diamond—46.1%
LMArena Expert1181—
ARC (AI2) Challenge64.3%—

Multilingual Not comparable

Deepseek Coder v2: 36.3 (#240), Qwen2.5 32B Instruct: —

Multilingual benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 32B Instruct
LMArena Non-English1182—
LMArena Chinese1201—
LMArena French1185—
LMArena German1164—
LMArena Japanese1126—
LMArena Korean1104—
LMArena Russian1188—
LMArena Spanish1153—

Instruction Following Not comparable

Deepseek Coder v2: 61.7 (#242), Qwen2.5 32B Instruct: —

Instruction Following benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 32B Instruct
LMArena Instruction Following1180—

Long Context Not comparable

Deepseek Coder v2: 37.0 (#224), Qwen2.5 32B Instruct: —

Long Context benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 32B Instruct
LMArena Longer Query1219—

Writing & Preference Not comparable

Deepseek Coder v2: 38.2 (#253), Qwen2.5 32B Instruct: —

Writing & Preference benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 32B Instruct
LMArena Text1191—
LMArena Creative Writing1120—
LMArena Multi-Turn1177—

Frequently asked questions

Is Deepseek Coder v2 better than Qwen2.5 32B Instruct?

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 30.1 on the Noometry Index.

Is Deepseek Coder v2 or Qwen2.5 32B Instruct better for coding?

They score almost the same on coding (38.1 vs 38.7); test both on your own repository before choosing.

How many benchmarks do Deepseek Coder v2 and Qwen2.5 32B Instruct share?

2 benchmarks have published results for both models. Deepseek Coder v2 has 24 scored results on Noometry and Qwen2.5 32B Instruct has 7.

Related comparisons

Go deeper