Model comparison

Kimi K2 Thinking Turbo vs Qwen Turbo

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 27.1 on the Noometry Index.

Last verified . 2 shared benchmarks.

Kimi K2 Thinking Turbo Moonshot AI

45.8

Rank #70 Confirmed

Qwen Turbo Alibaba (Qwen)

27.1

Rank #335 Reported

Summary

  • They share 2 benchmarks with published results for both. Kimi K2 Thinking Turbo scores higher in 2 categories and Qwen Turbo in 0 categories; 2 gaps are clear of the uncertainty.
  • The widest gap is in math, where Kimi K2 Thinking Turbo leads 47.4 to 15.3.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 83.1% for Kimi K2 Thinking Turbo and 6.1% for Qwen Turbo.
  • Kimi K2 Thinking Turbo has downloadable open weights; the other is API-only.

Side by side

Kimi K2 Thinking Turbo and Qwen Turbo specifications
Kimi K2 Thinking TurboQwen Turbo
ProviderMoonshot AIAlibaba (Qwen)
Noometry Index45.827.1
Released2025-11-062024-11-01
WeightsOpenProprietary
Context window—1M
Max output—16K
Input $ / M tokens—$0.05
Output $ / M tokens—$0.20
Results tracked213

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Not comparable

Kimi K2 Thinking Turbo: 38.4 (#178), Qwen Turbo: —

Coding benchmarks
BenchmarkKimi K2 Thinking TurboQwen Turbo
LMArena WebDev1322—
LMArena Coding1454—

Reasoning Not comparable

Kimi K2 Thinking Turbo: 32.5 (#75), Qwen Turbo: —

Reasoning benchmarks
BenchmarkKimi K2 Thinking TurboQwen Turbo
Chess Puzzles20%—
LMArena Hard Prompts1428—

Math Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 47.4 (#68), Qwen Turbo: 15.3 (#297)

Math benchmarks
BenchmarkKimi K2 Thinking TurboQwen Turbo
OTIS Mock AIME 2024-202583.1%6.1%
LMArena Math1429—
MATH Level 5—56.2%

Knowledge Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 50.9 (#69), Qwen Turbo: 22.2 (#272)

Knowledge benchmarks
BenchmarkKimi K2 Thinking TurboQwen Turbo
GPQA Diamond84.2%41.8%
LMArena Expert1439—

Multilingual Not comparable

Kimi K2 Thinking Turbo: 51.4 (#109), Qwen Turbo: —

Multilingual benchmarks
BenchmarkKimi K2 Thinking TurboQwen Turbo
LMArena Non-English1398—
LMArena Chinese1456—
LMArena French1425—
LMArena German1390—
LMArena Japanese1357—
LMArena Korean1330—
LMArena Russian1391—
LMArena Spanish1406—

Instruction Following Not comparable

Kimi K2 Thinking Turbo: 74.0 (#109), Qwen Turbo: —

Instruction Following benchmarks
BenchmarkKimi K2 Thinking TurboQwen Turbo
LMArena Instruction Following1403—

Long Context Not comparable

Kimi K2 Thinking Turbo: 43.2 (#102), Qwen Turbo: —

Long Context benchmarks
BenchmarkKimi K2 Thinking TurboQwen Turbo
LMArena Longer Query1415—

Writing & Preference Not comparable

Kimi K2 Thinking Turbo: 60.0 (#104), Qwen Turbo: —

Writing & Preference benchmarks
BenchmarkKimi K2 Thinking TurboQwen Turbo
LMArena Text1415—
LMArena Creative Writing1374—
LMArena Multi-Turn1414—

Frequently asked questions

Is Kimi K2 Thinking Turbo better than Qwen Turbo?

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 27.1 on the Noometry Index.

How many benchmarks do Kimi K2 Thinking Turbo and Qwen Turbo share?

2 benchmarks have published results for both models. Kimi K2 Thinking Turbo has 21 scored results on Noometry and Qwen Turbo has 3.

Related comparisons

Go deeper