Model comparison

Deepseek Coder v2 vs Qwen2.5 72B Instruct

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 31.9 on the Noometry Index.

Last verified . 21 shared benchmarks.

Deepseek Coder v2 DeepSeek

35.9

Rank #220 Confirmed

Qwen2.5 72B Instruct Alibaba (Qwen)

31.9

Rank #267 Confirmed

Summary

  • They share 21 benchmarks with published results for both. Deepseek Coder v2 scores higher in 4 categories and Qwen2.5 72B Instruct in 4 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Deepseek Coder v2 leads 34.9 to 19.3.

Side by side

Deepseek Coder v2 and Qwen2.5 72B Instruct specifications
Deepseek Coder v2Qwen2.5 72B Instruct
ProviderDeepSeekAlibaba (Qwen)
Noometry Index35.931.9
Released2024-06-172024-09
WeightsOpenOpen
Context window—131K
Max output—8K
Input $ / M tokens—$1.40
Output $ / M tokens—$5.60
Results tracked2443

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Deepseek Coder v2 leads

Deepseek Coder v2: 38.1 (#183), Qwen2.5 72B Instruct: 33.2 (#260)

Coding benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 72B Instruct
BigCodeBench Instruct48.2%45.8%
LMArena Coding12511292
BigCodeBench Complete59.7%55.9%
WeirdML—16%
HumanEval+82.3%—
MBPP+75.1%—

Agentic & Tool Use Not comparable

Deepseek Coder v2: —, Qwen2.5 72B Instruct: 22.1 (#133)

Agentic & Tool Use benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 72B Instruct
TheAgentCompany—5.7%
BALROG—16.2%
METR Time Horizons—35.8%

Reasoning Deepseek Coder v2 leads

Deepseek Coder v2: 23.6 (#176), Qwen2.5 72B Instruct: 22.3 (#199)

Reasoning benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 72B Instruct
LMArena Hard Prompts12071271
WinoGrande83.7%82.3%
DTBench—62.9%
LMCA—13.4%
BIG-Bench Hard—79.8%
Epoch Capabilities Index—129
ForecastBench—57.5
HellaSwag—84.8%
PIQA—82.6%

Math Deepseek Coder v2 leads

Deepseek Coder v2: 34.9 (#190), Qwen2.5 72B Instruct: 19.3 (#287)

Math benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 72B Instruct
LMArena Math12411283
OTIS Mock AIME 2024-2025—8.1%
Omni-MATH—33%
MATH Level 5—63.2%
GSM8K94.5%—

Knowledge Deepseek Coder v2 leads

Deepseek Coder v2: 32.3 (#212), Qwen2.5 72B Instruct: 27.0 (#253)

Knowledge benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 72B Instruct
LMArena Expert11811245
ARC (AI2) Challenge64.3%94.5%
GPQA Diamond—49.1%
MMLU-Pro—63.1%
Confabulations—19.1%
GPQA (HELM)—42.6%
MMLU—85.3%
TriviaQA—71.9%

Multilingual Qwen2.5 72B Instruct leads

Deepseek Coder v2: 36.3 (#240), Qwen2.5 72B Instruct: 41.0 (#213)

Multilingual benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 72B Instruct
LMArena Non-English11821252
LMArena Chinese12011272
LMArena French11851280
LMArena German11641234
LMArena Japanese11261180
LMArena Korean11041188
LMArena Russian11881264
LMArena Spanish11531256

Instruction Following Qwen2.5 72B Instruct leads

Deepseek Coder v2: 61.7 (#242), Qwen2.5 72B Instruct: 65.5 (#221)

Instruction Following benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 72B Instruct
LMArena Instruction Following11801254
IFEval—80.6%

Long Context Qwen2.5 72B Instruct leads

Deepseek Coder v2: 37.0 (#224), Qwen2.5 72B Instruct: 38.9 (#188)

Long Context benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 72B Instruct
LMArena Longer Query12191282

Writing & Preference Qwen2.5 72B Instruct leads

Deepseek Coder v2: 38.2 (#253), Qwen2.5 72B Instruct: 46.7 (#215)

Writing & Preference benchmarks
BenchmarkDeepseek Coder v2Qwen2.5 72B Instruct
LMArena Text11911269
LMArena Creative Writing11201221
LMArena Multi-Turn11771272
WildBench—80.2%

Frequently asked questions

Is Deepseek Coder v2 better than Qwen2.5 72B Instruct?

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 31.9 on the Noometry Index.

Is Deepseek Coder v2 or Qwen2.5 72B Instruct better for coding?

Deepseek Coder v2 scores higher on coding benchmarks: 38.1 versus 33.2 in the Noometry coding category.

How many benchmarks do Deepseek Coder v2 and Qwen2.5 72B Instruct share?

21 benchmarks have published results for both models. Deepseek Coder v2 has 24 scored results on Noometry and Qwen2.5 72B Instruct has 43.

Related comparisons

Go deeper