Model comparison

DeepSeek Coder 33B vs Qwen1.5 4b Chat

Qwen1.5 4b Chat has enough public results to be ranked (#322); DeepSeek Coder 33B does not yet, so treat this comparison as directional.

Last verified . 0 shared benchmarks.

DeepSeek Coder 33B DeepSeek

38.9

Unranked Sparse

Qwen1.5 4b Chat Alibaba (Qwen)

28.8

Rank #322 Confirmed

Summary

  • The widest gap is in coding, where DeepSeek Coder 33B leads 38.0 to 29.1.

Side by side

DeepSeek Coder 33B and Qwen1.5 4b Chat specifications
DeepSeek Coder 33BQwen1.5 4b Chat
ProviderDeepSeekAlibaba (Qwen)
Noometry Index38.928.8
Released2023-11-02—
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked913

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding DeepSeek Coder 33B leads

DeepSeek Coder 33B: 38.0 (#184), Qwen1.5 4b Chat: 29.1 (#308)

Coding benchmarks
BenchmarkDeepSeek Coder 33BQwen1.5 4b Chat
BigCodeBench Instruct42%—
LMArena Coding—999
BigCodeBench Complete51.1%—
HumanEval+75%—
MBPP+70.1%—

Reasoning Not comparable

DeepSeek Coder 33B: —, Qwen1.5 4b Chat: 18.5 (#279)

Reasoning benchmarks
BenchmarkDeepSeek Coder 33BQwen1.5 4b Chat
LMArena Hard Prompts—976
Epoch Capabilities Index96.32—
WinoGrande62%—

Math Not comparable

DeepSeek Coder 33B: —, Qwen1.5 4b Chat: 30.4 (#234)

Math benchmarks
BenchmarkDeepSeek Coder 33BQwen1.5 4b Chat
LMArena Math—1026
GSM8K35.4%—

Knowledge Not comparable

DeepSeek Coder 33B: —, Qwen1.5 4b Chat: 26.7 (#255)

Knowledge benchmarks
BenchmarkDeepSeek Coder 33BQwen1.5 4b Chat
LMArena Expert—980
ARC (AI2) Challenge42.2%—
MMLU39.4%—

Multilingual Not comparable

DeepSeek Coder 33B: —, Qwen1.5 4b Chat: 24.1 (#290)

Multilingual benchmarks
BenchmarkDeepSeek Coder 33BQwen1.5 4b Chat
LMArena Non-English—979
LMArena Chinese—1024
LMArena German—902
LMArena Russian—952

Instruction Following Not comparable

DeepSeek Coder 33B: —, Qwen1.5 4b Chat: 49.0 (#300)

Instruction Following benchmarks
BenchmarkDeepSeek Coder 33BQwen1.5 4b Chat
LMArena Instruction Following—978

Long Context Not comparable

DeepSeek Coder 33B: —, Qwen1.5 4b Chat: 30.1 (#290)

Long Context benchmarks
BenchmarkDeepSeek Coder 33BQwen1.5 4b Chat
LMArena Longer Query—988

Writing & Preference Not comparable

DeepSeek Coder 33B: —, Qwen1.5 4b Chat: 23.8 (#309)

Writing & Preference benchmarks
BenchmarkDeepSeek Coder 33BQwen1.5 4b Chat
LMArena Text—997
LMArena Creative Writing—969
LMArena Multi-Turn—977

Frequently asked questions

Is DeepSeek Coder 33B better than Qwen1.5 4b Chat?

Qwen1.5 4b Chat has enough public results to be ranked (#322); DeepSeek Coder 33B does not yet, so treat this comparison as directional.

Is DeepSeek Coder 33B or Qwen1.5 4b Chat better for coding?

DeepSeek Coder 33B scores higher on coding benchmarks: 38.0 versus 29.1 in the Noometry coding category.

How many benchmarks do DeepSeek Coder 33B and Qwen1.5 4b Chat share?

0 benchmarks have published results for both models. DeepSeek Coder 33B has 9 scored results on Noometry and Qwen1.5 4b Chat has 13.

Related comparisons

Go deeper