Model comparison

Kimi K2 Thinking Turbo vs Magistral Small

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 30.2 on the Noometry Index.

Last verified . 3 shared benchmarks.

Kimi K2 Thinking Turbo Moonshot AI

45.8

Rank #70 Confirmed

Magistral Small Mistral AI

30.2

Rank #296 Confirmed

Summary

  • They share 3 benchmarks with published results for both. Kimi K2 Thinking Turbo scores higher in 3 categories and Magistral Small in 1 category; 3 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Kimi K2 Thinking Turbo leads 32.5 to 6.8.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 83.1% for Kimi K2 Thinking Turbo and 30% for Magistral Small.

Side by side

Kimi K2 Thinking Turbo and Magistral Small specifications
Kimi K2 Thinking TurboMagistral Small
ProviderMoonshot AIMistral AI
Noometry Index45.830.2
Released2025-11-062025-06-10
WeightsOpenOpen
Context window—128K
Max output—40K
Input $ / M tokens—$0.50
Output $ / M tokens—$1.50
Results tracked2110

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

Kimi K2 Thinking Turbo: 38.4 (#178), Magistral Small: 38.4 (#176)

Coding benchmarks
BenchmarkKimi K2 Thinking TurboMagistral Small
LMArena WebDev1322—
SciCode—35.2%
LMArena Coding1454—

Reasoning Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 32.5 (#75), Magistral Small: 6.8 (#350)

Reasoning benchmarks
BenchmarkKimi K2 Thinking TurboMagistral Small
Chess Puzzles20%3%
ARC-AGI-2—0%
Kagi LLM Benchmark—6.3%
ARC-AGI-1—5%
CritPt—0.3%
LMArena Hard Prompts1428—
DTBench—61.3%
Epoch Capabilities Index—133.19

Math Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 47.4 (#68), Magistral Small: 26.2 (#261)

Math benchmarks
BenchmarkKimi K2 Thinking TurboMagistral Small
OTIS Mock AIME 2024-202583.1%30%
LMArena Math1429—

Knowledge Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 50.9 (#69), Magistral Small: 30.9 (#223)

Knowledge benchmarks
BenchmarkKimi K2 Thinking TurboMagistral Small
GPQA Diamond84.2%56.1%
LMArena Expert1439—

Multilingual Not comparable

Kimi K2 Thinking Turbo: 51.4 (#109), Magistral Small: —

Multilingual benchmarks
BenchmarkKimi K2 Thinking TurboMagistral Small
LMArena Non-English1398—
LMArena Chinese1456—
LMArena French1425—
LMArena German1390—
LMArena Japanese1357—
LMArena Korean1330—
LMArena Russian1391—
LMArena Spanish1406—

Instruction Following Not comparable

Kimi K2 Thinking Turbo: 74.0 (#109), Magistral Small: —

Instruction Following benchmarks
BenchmarkKimi K2 Thinking TurboMagistral Small
LMArena Instruction Following1403—

Long Context Not comparable

Kimi K2 Thinking Turbo: 43.2 (#102), Magistral Small: —

Long Context benchmarks
BenchmarkKimi K2 Thinking TurboMagistral Small
LMArena Longer Query1415—

Writing & Preference Not comparable

Kimi K2 Thinking Turbo: 60.0 (#104), Magistral Small: —

Writing & Preference benchmarks
BenchmarkKimi K2 Thinking TurboMagistral Small
LMArena Text1415—
LMArena Creative Writing1374—
LMArena Multi-Turn1414—

Frequently asked questions

Is Kimi K2 Thinking Turbo better than Magistral Small?

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 30.2 on the Noometry Index.

Is Kimi K2 Thinking Turbo or Magistral Small better for coding?

They score almost the same on coding (38.4 vs 38.4); test both on your own repository before choosing.

How many benchmarks do Kimi K2 Thinking Turbo and Magistral Small share?

3 benchmarks have published results for both models. Kimi K2 Thinking Turbo has 21 scored results on Noometry and Magistral Small has 10.

Related comparisons

Go deeper