Model comparison

Claude 3.5 Haiku vs Deepseek Coder v2

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 29.2 on the Noometry Index.

Last verified . 19 shared benchmarks.

Claude 3.5 Haiku Anthropic

29.2

Rank #315 Confirmed

Deepseek Coder v2 DeepSeek

35.9

Rank #220 Confirmed

Summary

  • They share 19 benchmarks with published results for both. Claude 3.5 Haiku scores higher in 4 categories and Deepseek Coder v2 in 4 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Deepseek Coder v2 leads 34.9 to 14.7.
  • Deepseek Coder v2 has downloadable open weights; the other is API-only.

Side by side

Claude 3.5 Haiku and Deepseek Coder v2 specifications
Claude 3.5 HaikuDeepseek Coder v2
ProviderAnthropicDeepSeek
Noometry Index29.235.9
Released2024-10-222024-06-17
WeightsProprietaryOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked4924

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Deepseek Coder v2 leads

Claude 3.5 Haiku: 32.9 (#265), Deepseek Coder v2: 38.1 (#183)

Coding benchmarks
BenchmarkClaude 3.5 HaikuDeepseek Coder v2
BigCodeBench Instruct46.1%48.2%
LMArena Coding12861251
BigCodeBench Complete59%59.7%
Aider Polyglot28%—
SciCode27.4%—
WeirdML30.7%—
LiveBench Coding51.4%—
CadEval32%—
HumanEval+—82.3%
MBPP+—75.1%

Agentic & Tool Use Not comparable

Claude 3.5 Haiku: 28.0 (#95), Deepseek Coder v2: —

Agentic & Tool Use benchmarks
BenchmarkClaude 3.5 HaikuDeepseek Coder v2
BALROG19.3%—

Reasoning Deepseek Coder v2 leads

Claude 3.5 Haiku: 17.7 (#290), Deepseek Coder v2: 23.6 (#176)

Reasoning benchmarks
BenchmarkClaude 3.5 HaikuDeepseek Coder v2
LMArena Hard Prompts12511207
CritPt0%—
LiveBench Reasoning28.1%—
DTBench56.7%—
LiveBench Data Analysis48.5%—
Epoch Capabilities Index127.15—
LiveBench43.5%—
WinoGrande—83.7%

Math Deepseek Coder v2 leads

Claude 3.5 Haiku: 14.7 (#300), Deepseek Coder v2: 34.9 (#190)

Math benchmarks
BenchmarkClaude 3.5 HaikuDeepseek Coder v2
LMArena Math12441241
OTIS Mock AIME 2024-20254.3%—
Omni-MATH22.4%—
LiveBench Math35.5%—
MATH Level 546.4%—
FrontierMath (Feb 2025 set)0.3%—
GSM8K—94.5%

Knowledge Deepseek Coder v2 leads

Claude 3.5 Haiku: 18.7 (#281), Deepseek Coder v2: 32.3 (#212)

Knowledge benchmarks
BenchmarkClaude 3.5 HaikuDeepseek Coder v2
LMArena Expert12081181
GPQA Diamond38.1%—
MMLU-Pro60.5%—
Confabulations36.7%—
GPQA (HELM)36.3%—
ARC (AI2) Challenge—64.3%
MMLU74.3%—

Multimodal Not comparable

Claude 3.5 Haiku: 26.8 (#117), Deepseek Coder v2: —

Multimodal benchmarks
BenchmarkClaude 3.5 HaikuDeepseek Coder v2
LMArena Vision1092—
GeoBench34%—

Multilingual Claude 3.5 Haiku leads

Claude 3.5 Haiku: 40.0 (#218), Deepseek Coder v2: 36.3 (#240)

Multilingual benchmarks
BenchmarkClaude 3.5 HaikuDeepseek Coder v2
LMArena Non-English12381182
LMArena Chinese12291201
LMArena French12641185
LMArena German12371164
LMArena Japanese11751126
LMArena Korean11731104
LMArena Russian12531188
LMArena Spanish12611153

Instruction Following Claude 3.5 Haiku leads

Claude 3.5 Haiku: 62.9 (#234), Deepseek Coder v2: 61.7 (#242)

Instruction Following benchmarks
BenchmarkClaude 3.5 HaikuDeepseek Coder v2
LMArena Instruction Following12411180
LiveBench Instruction Following61.9%—
IFEval79.2%—

Long Context Claude 3.5 Haiku leads

Claude 3.5 Haiku: 38.3 (#200), Deepseek Coder v2: 37.0 (#224)

Long Context benchmarks
BenchmarkClaude 3.5 HaikuDeepseek Coder v2
LMArena Longer Query12611219

Writing & Preference Claude 3.5 Haiku leads

Claude 3.5 Haiku: 42.7 (#234), Deepseek Coder v2: 38.2 (#253)

Writing & Preference benchmarks
BenchmarkClaude 3.5 HaikuDeepseek Coder v2
LMArena Text12551191
LMArena Creative Writing12331120
LMArena Multi-Turn12651177
Short-Story Creative Writing73.5%—
EQ-Bench Creative Writing1146—
WildBench76%—
LiveBench Language35.4%—

Frequently asked questions

Is Claude 3.5 Haiku better than Deepseek Coder v2?

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 29.2 on the Noometry Index.

Is Claude 3.5 Haiku or Deepseek Coder v2 better for coding?

Deepseek Coder v2 scores higher on coding benchmarks: 38.1 versus 32.9 in the Noometry coding category.

How many benchmarks do Claude 3.5 Haiku and Deepseek Coder v2 share?

19 benchmarks have published results for both models. Claude 3.5 Haiku has 49 scored results on Noometry and Deepseek Coder v2 has 24.

Related comparisons

Go deeper