Model comparison

Kimi K2 Thinking Turbo vs Qwen2.5 32B Instruct

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 30.1 on the Noometry Index.

Last verified . 3 shared benchmarks.

Kimi K2 Thinking Turbo Moonshot AI

45.8

Rank #70 Confirmed

Qwen2.5 32B Instruct Alibaba (Qwen)

30.1

Rank #297 Confirmed

Summary

  • They share 3 benchmarks with published results for both. Kimi K2 Thinking Turbo scores higher in 3 categories and Qwen2.5 32B Instruct in 1 category; 3 gaps are clear of the uncertainty.
  • The widest gap is in math, where Kimi K2 Thinking Turbo leads 47.4 to 16.2.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 83.1% for Kimi K2 Thinking Turbo and 7.4% for Qwen2.5 32B Instruct.

Side by side

Kimi K2 Thinking Turbo and Qwen2.5 32B Instruct specifications
Kimi K2 Thinking TurboQwen2.5 32B Instruct
ProviderMoonshot AIAlibaba (Qwen)
Noometry Index45.830.1
Released2025-11-062024-09
WeightsOpenOpen
Context window—131K
Max output—8K
Input $ / M tokens—$0.70
Output $ / M tokens—$2.80
Results tracked217

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

Kimi K2 Thinking Turbo: 38.4 (#178), Qwen2.5 32B Instruct: 38.7 (#169)

Coding benchmarks
BenchmarkKimi K2 Thinking TurboQwen2.5 32B Instruct
LMArena WebDev1322—
BigCodeBench Instruct—45%
LMArena Coding1454—
BigCodeBench Complete—52.3%

Reasoning Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 32.5 (#75), Qwen2.5 32B Instruct: 19.2 (#266)

Reasoning benchmarks
BenchmarkKimi K2 Thinking TurboQwen2.5 32B Instruct
Chess Puzzles20%0%
LMArena Hard Prompts1428—
Epoch Capabilities Index—128.52

Math Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 47.4 (#68), Qwen2.5 32B Instruct: 16.2 (#296)

Math benchmarks
BenchmarkKimi K2 Thinking TurboQwen2.5 32B Instruct
OTIS Mock AIME 2024-202583.1%7.4%
LMArena Math1429—
MATH Level 5—56.1%

Knowledge Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 50.9 (#69), Qwen2.5 32B Instruct: 24.9 (#266)

Knowledge benchmarks
BenchmarkKimi K2 Thinking TurboQwen2.5 32B Instruct
GPQA Diamond84.2%46.1%
LMArena Expert1439—

Multilingual Not comparable

Kimi K2 Thinking Turbo: 51.4 (#109), Qwen2.5 32B Instruct: —

Multilingual benchmarks
BenchmarkKimi K2 Thinking TurboQwen2.5 32B Instruct
LMArena Non-English1398—
LMArena Chinese1456—
LMArena French1425—
LMArena German1390—
LMArena Japanese1357—
LMArena Korean1330—
LMArena Russian1391—
LMArena Spanish1406—

Instruction Following Not comparable

Kimi K2 Thinking Turbo: 74.0 (#109), Qwen2.5 32B Instruct: —

Instruction Following benchmarks
BenchmarkKimi K2 Thinking TurboQwen2.5 32B Instruct
LMArena Instruction Following1403—

Long Context Not comparable

Kimi K2 Thinking Turbo: 43.2 (#102), Qwen2.5 32B Instruct: —

Long Context benchmarks
BenchmarkKimi K2 Thinking TurboQwen2.5 32B Instruct
LMArena Longer Query1415—

Writing & Preference Not comparable

Kimi K2 Thinking Turbo: 60.0 (#104), Qwen2.5 32B Instruct: —

Writing & Preference benchmarks
BenchmarkKimi K2 Thinking TurboQwen2.5 32B Instruct
LMArena Text1415—
LMArena Creative Writing1374—
LMArena Multi-Turn1414—

Frequently asked questions

Is Kimi K2 Thinking Turbo better than Qwen2.5 32B Instruct?

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 30.1 on the Noometry Index.

Is Kimi K2 Thinking Turbo or Qwen2.5 32B Instruct better for coding?

They score almost the same on coding (38.4 vs 38.7); test both on your own repository before choosing.

How many benchmarks do Kimi K2 Thinking Turbo and Qwen2.5 32B Instruct share?

3 benchmarks have published results for both models. Kimi K2 Thinking Turbo has 21 scored results on Noometry and Qwen2.5 32B Instruct has 7.

Related comparisons

Go deeper