Model comparison

Kimi K2 Thinking Turbo vs phi-3-medium 14B

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 29.7 on the Noometry Index.

Last verified . 1 shared benchmarks.

Kimi K2 Thinking Turbo Moonshot AI

45.8

Rank #70 Confirmed

phi-3-medium 14B Microsoft

29.7

Rank #306 Reported

Summary

  • They share 1 benchmark with published results for both. Kimi K2 Thinking Turbo scores higher in 3 categories and phi-3-medium 14B in 0 categories; 3 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Kimi K2 Thinking Turbo leads 50.9 to 9.1.
  • The biggest single-benchmark swing is GPQA Diamond: 84.2% for Kimi K2 Thinking Turbo and 27.6% for phi-3-medium 14B.

Side by side

Kimi K2 Thinking Turbo and phi-3-medium 14B specifications
Kimi K2 Thinking Turbophi-3-medium 14B
ProviderMoonshot AIMicrosoft
Noometry Index45.829.7
Released2025-11-062024-04-23
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked2113

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 38.4 (#178), phi-3-medium 14B: 36.8 (#201)

Coding benchmarks
BenchmarkKimi K2 Thinking Turbophi-3-medium 14B
LMArena WebDev1322—
BigCodeBench Instruct—37.6%
LMArena Coding1454—
BigCodeBench Complete—48.7%

Reasoning Not comparable

Kimi K2 Thinking Turbo: 32.5 (#75), phi-3-medium 14B: —

Reasoning benchmarks
BenchmarkKimi K2 Thinking Turbophi-3-medium 14B
Chess Puzzles20%—
LMArena Hard Prompts1428—
Adversarial NLI—55.8%
BIG-Bench Hard—81.4%
Epoch Capabilities Index—121.23
HellaSwag—82.4%
WinoGrande—81.5%

Math Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 47.4 (#68), phi-3-medium 14B: 27.3 (#250)

Math benchmarks
BenchmarkKimi K2 Thinking Turbophi-3-medium 14B
OTIS Mock AIME 2024-202583.1%—
LMArena Math1429—
MATH Level 5—17.6%

Knowledge Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 50.9 (#69), phi-3-medium 14B: 9.1 (#306)

Knowledge benchmarks
BenchmarkKimi K2 Thinking Turbophi-3-medium 14B
GPQA Diamond84.2%27.6%
LMArena Expert1439—
ARC (AI2) Challenge—91.6%
MMLU—78%
OpenBookQA—87.4%
TriviaQA—73.9%

Multilingual Not comparable

Kimi K2 Thinking Turbo: 51.4 (#109), phi-3-medium 14B: —

Multilingual benchmarks
BenchmarkKimi K2 Thinking Turbophi-3-medium 14B
LMArena Non-English1398—
LMArena Chinese1456—
LMArena French1425—
LMArena German1390—
LMArena Japanese1357—
LMArena Korean1330—
LMArena Russian1391—
LMArena Spanish1406—

Instruction Following Not comparable

Kimi K2 Thinking Turbo: 74.0 (#109), phi-3-medium 14B: —

Instruction Following benchmarks
BenchmarkKimi K2 Thinking Turbophi-3-medium 14B
LMArena Instruction Following1403—

Long Context Not comparable

Kimi K2 Thinking Turbo: 43.2 (#102), phi-3-medium 14B: —

Long Context benchmarks
BenchmarkKimi K2 Thinking Turbophi-3-medium 14B
LMArena Longer Query1415—

Writing & Preference Not comparable

Kimi K2 Thinking Turbo: 60.0 (#104), phi-3-medium 14B: —

Writing & Preference benchmarks
BenchmarkKimi K2 Thinking Turbophi-3-medium 14B
LMArena Text1415—
LMArena Creative Writing1374—
LMArena Multi-Turn1414—

Frequently asked questions

Is Kimi K2 Thinking Turbo better than phi-3-medium 14B?

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 29.7 on the Noometry Index.

Is Kimi K2 Thinking Turbo or phi-3-medium 14B better for coding?

Kimi K2 Thinking Turbo scores higher on coding benchmarks: 38.4 versus 36.8 in the Noometry coding category.

How many benchmarks do Kimi K2 Thinking Turbo and phi-3-medium 14B share?

1 benchmark has published results for both models. Kimi K2 Thinking Turbo has 21 scored results on Noometry and phi-3-medium 14B has 13.

Related comparisons

Go deeper