Model comparison

Codellama 70b Instruct vs Deepseek Coder v2

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 33.7 on the Noometry Index.

Last verified . 7 shared benchmarks.

Codellama 70b Instruct Meta

33.7

Rank #237 Confirmed

Deepseek Coder v2 DeepSeek

35.9

Rank #220 Confirmed

Summary

  • They share 7 benchmarks with published results for both. Codellama 70b Instruct scores higher in 0 categories and Deepseek Coder v2 in 5 categories; 4 gaps are clear of the uncertainty.
  • The widest gap is in multilingual, where Deepseek Coder v2 leads 36.3 to 24.8.
  • The biggest single-benchmark swing is BigCodeBench Complete: 49.6% for Codellama 70b Instruct and 59.7% for Deepseek Coder v2.

Side by side

Codellama 70b Instruct and Deepseek Coder v2 specifications
Codellama 70b InstructDeepseek Coder v2
ProviderMetaDeepSeek
Noometry Index33.735.9
Released—2024-06-17
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked724

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

Codellama 70b Instruct: 37.6 (#193), Deepseek Coder v2: 38.1 (#183)

Coding benchmarks
BenchmarkCodellama 70b InstructDeepseek Coder v2
BigCodeBench Instruct40.7%48.2%
BigCodeBench Complete49.6%59.7%
HumanEval+65.9%82.3%
LMArena Coding—1251
MBPP+—75.1%

Reasoning Deepseek Coder v2 leads

Codellama 70b Instruct: 20.1 (#242), Deepseek Coder v2: 23.6 (#176)

Reasoning benchmarks
BenchmarkCodellama 70b InstructDeepseek Coder v2
LMArena Hard Prompts10521207
WinoGrande—83.7%

Math Not comparable

Codellama 70b Instruct: —, Deepseek Coder v2: 34.9 (#190)

Math benchmarks
BenchmarkCodellama 70b InstructDeepseek Coder v2
LMArena Math—1241
GSM8K—94.5%

Knowledge Not comparable

Codellama 70b Instruct: —, Deepseek Coder v2: 32.3 (#212)

Knowledge benchmarks
BenchmarkCodellama 70b InstructDeepseek Coder v2
LMArena Expert—1181
ARC (AI2) Challenge—64.3%

Multilingual Deepseek Coder v2 leads

Codellama 70b Instruct: 24.8 (#288), Deepseek Coder v2: 36.3 (#240)

Multilingual benchmarks
BenchmarkCodellama 70b InstructDeepseek Coder v2
LMArena Non-English9921182
LMArena Chinese—1201
LMArena French—1185
LMArena German—1164
LMArena Japanese—1126
LMArena Korean—1104
LMArena Russian—1188
LMArena Spanish—1153

Instruction Following Deepseek Coder v2 leads

Codellama 70b Instruct: 51.9 (#293), Deepseek Coder v2: 61.7 (#242)

Instruction Following benchmarks
BenchmarkCodellama 70b InstructDeepseek Coder v2
LMArena Instruction Following10241180

Long Context Not comparable

Codellama 70b Instruct: —, Deepseek Coder v2: 37.0 (#224)

Long Context benchmarks
BenchmarkCodellama 70b InstructDeepseek Coder v2
LMArena Longer Query—1219

Writing & Preference Deepseek Coder v2 leads

Codellama 70b Instruct: 33.4 (#277), Deepseek Coder v2: 38.2 (#253)

Writing & Preference benchmarks
BenchmarkCodellama 70b InstructDeepseek Coder v2
LMArena Text10571191
LMArena Creative Writing—1120
LMArena Multi-Turn—1177

Frequently asked questions

Is Codellama 70b Instruct better than Deepseek Coder v2?

Deepseek Coder v2 is the stronger model overall, scoring 35.9 to 33.7 on the Noometry Index.

Is Codellama 70b Instruct or Deepseek Coder v2 better for coding?

They score almost the same on coding (37.6 vs 38.1); test both on your own repository before choosing.

How many benchmarks do Codellama 70b Instruct and Deepseek Coder v2 share?

7 benchmarks have published results for both models. Codellama 70b Instruct has 7 scored results on Noometry and Deepseek Coder v2 has 24.

Related comparisons

Go deeper