Model comparison

Deepseek Coder v2 vs Qwen3.8 27B

Qwen3.8 27B is the stronger model overall, scoring 46.0 to 35.9 on the Noometry Index.

Last verified . 17 shared benchmarks.

Deepseek Coder v2 DeepSeek

35.9

Rank #220 Confirmed

Qwen3.8 27B Alibaba (Qwen)

46.0

Rank #68 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Deepseek Coder v2 scores higher in 0 categories and Qwen3.8 27B in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Qwen3.8 27B leads 65.8 to 38.2.

Side by side

Deepseek Coder v2 and Qwen3.8 27B specifications
Deepseek Coder v2Qwen3.8 27B
ProviderDeepSeekAlibaba (Qwen)
Noometry Index35.946.0
Released2024-06-172026-08-14
WeightsOpenOpen
Context window—262K
Max output—33K
Input $ / M tokens—$0.99
Output $ / M tokens—$1.49
Results tracked2431

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Qwen3.8 27B leads

Deepseek Coder v2: 38.1 (#183), Qwen3.8 27B: 50.5 (#44)

Coding benchmarks
BenchmarkDeepseek Coder v2Qwen3.8 27B
LMArena Coding12511482
LMArena WebDev—1593
SciCode—46.6%
BigCodeBench Instruct48.2%—
BigCodeBench Complete59.7%—
HumanEval+82.3%—
MBPP+75.1%—

Agentic & Tool Use Not comparable

Deepseek Coder v2: —, Qwen3.8 27B: 32.9 (#57)

Agentic & Tool Use benchmarks
BenchmarkDeepseek Coder v2Qwen3.8 27B
APEX-Agents—47.5%

Reasoning Qwen3.8 27B leads

Deepseek Coder v2: 23.6 (#176), Qwen3.8 27B: 41.0 (#54)

Reasoning benchmarks
BenchmarkDeepseek Coder v2Qwen3.8 27B
LMArena Hard Prompts12071460
ARC-AGI-2—42.4%
NYT Connections (extended)—54.5%
ARC-AGI-1—87.5%
CritPt—5.4%
DTBench—88%
LMCA—41.4%
Surface Evolver Bench—45%
Epoch Capabilities Index—149.38
WinoGrande83.7%—

Math Qwen3.8 27B leads

Deepseek Coder v2: 34.9 (#190), Qwen3.8 27B: 37.1 (#161)

Math benchmarks
BenchmarkDeepseek Coder v2Qwen3.8 27B
LMArena Math12411456
ProofBench—16%
GSM8K94.5%—

Knowledge Qwen3.8 27B leads

Deepseek Coder v2: 32.3 (#212), Qwen3.8 27B: 41.6 (#109)

Knowledge benchmarks
BenchmarkDeepseek Coder v2Qwen3.8 27B
LMArena Expert11811482
ARC (AI2) Challenge64.3%—

Multimodal Not comparable

Deepseek Coder v2: —, Qwen3.8 27B: 41.3 (#37)

Multimodal benchmarks
BenchmarkDeepseek Coder v2Qwen3.8 27B
LMArena Vision—1271

Multilingual Qwen3.8 27B leads

Deepseek Coder v2: 36.3 (#240), Qwen3.8 27B: 53.7 (#60)

Multilingual benchmarks
BenchmarkDeepseek Coder v2Qwen3.8 27B
LMArena Non-English11821430
LMArena Chinese12011504
LMArena French11851465
LMArena German11641438
LMArena Japanese11261384
LMArena Korean11041393
LMArena Russian11881415
LMArena Spanish11531448

Instruction Following Qwen3.8 27B leads

Deepseek Coder v2: 61.7 (#242), Qwen3.8 27B: 75.8 (#53)

Instruction Following benchmarks
BenchmarkDeepseek Coder v2Qwen3.8 27B
LMArena Instruction Following11801439

Long Context Qwen3.8 27B leads

Deepseek Coder v2: 37.0 (#224), Qwen3.8 27B: 44.3 (#70)

Long Context benchmarks
BenchmarkDeepseek Coder v2Qwen3.8 27B
LMArena Longer Query12191450

Writing & Preference Qwen3.8 27B leads

Deepseek Coder v2: 38.2 (#253), Qwen3.8 27B: 65.8 (#43)

Writing & Preference benchmarks
BenchmarkDeepseek Coder v2Qwen3.8 27B
LMArena Text11911441
LMArena Creative Writing11201384
LMArena Multi-Turn11771441
EQ-Bench Creative Writing—1671

Frequently asked questions

Is Deepseek Coder v2 better than Qwen3.8 27B?

Qwen3.8 27B is the stronger model overall, scoring 46.0 to 35.9 on the Noometry Index.

Is Deepseek Coder v2 or Qwen3.8 27B better for coding?

Qwen3.8 27B scores higher on coding benchmarks: 50.5 versus 38.1 in the Noometry coding category.

How many benchmarks do Deepseek Coder v2 and Qwen3.8 27B share?

17 benchmarks have published results for both models. Deepseek Coder v2 has 24 scored results on Noometry and Qwen3.8 27B has 31.

Related comparisons

Go deeper