Model comparison

Deepseek Coder v2 vs Kimi K2 Thinking Turbo

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 35.9 on the Noometry Index.

Last verified . 17 shared benchmarks.

Deepseek Coder v2 DeepSeek

35.9

Rank #220 Confirmed

Kimi K2 Thinking Turbo Moonshot AI

45.8

Rank #70 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Deepseek Coder v2 scores higher in 0 categories and Kimi K2 Thinking Turbo in 8 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Kimi K2 Thinking Turbo leads 60.0 to 38.2.

Side by side

Deepseek Coder v2 and Kimi K2 Thinking Turbo specifications
Deepseek Coder v2Kimi K2 Thinking Turbo
ProviderDeepSeekMoonshot AI
Noometry Index35.945.8
Released2024-06-172025-11-06
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked2421

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

Deepseek Coder v2: 38.1 (#183), Kimi K2 Thinking Turbo: 38.4 (#178)

Coding benchmarks
BenchmarkDeepseek Coder v2Kimi K2 Thinking Turbo
LMArena Coding12511454
LMArena WebDev—1322
BigCodeBench Instruct48.2%—
BigCodeBench Complete59.7%—
HumanEval+82.3%—
MBPP+75.1%—

Reasoning Kimi K2 Thinking Turbo leads

Deepseek Coder v2: 23.6 (#176), Kimi K2 Thinking Turbo: 32.5 (#75)

Reasoning benchmarks
BenchmarkDeepseek Coder v2Kimi K2 Thinking Turbo
LMArena Hard Prompts12071428
Chess Puzzles—20%
WinoGrande83.7%—

Math Kimi K2 Thinking Turbo leads

Deepseek Coder v2: 34.9 (#190), Kimi K2 Thinking Turbo: 47.4 (#68)

Math benchmarks
BenchmarkDeepseek Coder v2Kimi K2 Thinking Turbo
LMArena Math12411429
OTIS Mock AIME 2024-2025—83.1%
GSM8K94.5%—

Knowledge Kimi K2 Thinking Turbo leads

Deepseek Coder v2: 32.3 (#212), Kimi K2 Thinking Turbo: 50.9 (#69)

Knowledge benchmarks
BenchmarkDeepseek Coder v2Kimi K2 Thinking Turbo
LMArena Expert11811439
GPQA Diamond—84.2%
ARC (AI2) Challenge64.3%—

Multilingual Kimi K2 Thinking Turbo leads

Deepseek Coder v2: 36.3 (#240), Kimi K2 Thinking Turbo: 51.4 (#109)

Multilingual benchmarks
BenchmarkDeepseek Coder v2Kimi K2 Thinking Turbo
LMArena Non-English11821398
LMArena Chinese12011456
LMArena French11851425
LMArena German11641390
LMArena Japanese11261357
LMArena Korean11041330
LMArena Russian11881391
LMArena Spanish11531406

Instruction Following Kimi K2 Thinking Turbo leads

Deepseek Coder v2: 61.7 (#242), Kimi K2 Thinking Turbo: 74.0 (#109)

Instruction Following benchmarks
BenchmarkDeepseek Coder v2Kimi K2 Thinking Turbo
LMArena Instruction Following11801403

Long Context Kimi K2 Thinking Turbo leads

Deepseek Coder v2: 37.0 (#224), Kimi K2 Thinking Turbo: 43.2 (#102)

Long Context benchmarks
BenchmarkDeepseek Coder v2Kimi K2 Thinking Turbo
LMArena Longer Query12191415

Writing & Preference Kimi K2 Thinking Turbo leads

Deepseek Coder v2: 38.2 (#253), Kimi K2 Thinking Turbo: 60.0 (#104)

Writing & Preference benchmarks
BenchmarkDeepseek Coder v2Kimi K2 Thinking Turbo
LMArena Text11911415
LMArena Creative Writing11201374
LMArena Multi-Turn11771414

Frequently asked questions

Is Deepseek Coder v2 better than Kimi K2 Thinking Turbo?

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 35.9 on the Noometry Index.

Is Deepseek Coder v2 or Kimi K2 Thinking Turbo better for coding?

They score almost the same on coding (38.1 vs 38.4); test both on your own repository before choosing.

How many benchmarks do Deepseek Coder v2 and Kimi K2 Thinking Turbo share?

17 benchmarks have published results for both models. Deepseek Coder v2 has 24 scored results on Noometry and Kimi K2 Thinking Turbo has 21.

Related comparisons

Go deeper