Model comparison

Kimi K2.5 Instant vs Phi-4 Mini

Kimi K2.5 Instant is the stronger model overall, scoring 43.6 to 30.9 on the Noometry Index.

Last verified . 0 shared benchmarks.

Kimi K2.5 Instant Moonshot AI

43.6

Rank #89 Confirmed

Phi-4 Mini Microsoft

30.9

Rank #283 Reported

Summary

  • The widest gap is in knowledge, where Kimi K2.5 Instant leads 40.2 to 25.3.

Side by side

Kimi K2.5 Instant and Phi-4 Mini specifications
Kimi K2.5 InstantPhi-4 Mini
ProviderMoonshot AIMicrosoft
Noometry Index43.630.9
Released—2024-12-11
WeightsOpenOpen
Context window—128K
Max output—4K
Input $ / M tokens—$0.075
Output $ / M tokens—$0.30
Results tracked183

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Kimi K2.5 Instant leads

Kimi K2.5 Instant: 42.6 (#97), Phi-4 Mini: 28.1 (#317)

Coding benchmarks
BenchmarkKimi K2.5 InstantPhi-4 Mini
LMArena WebDev1404—
SciCode—10.8%
LMArena Coding1484—

Reasoning Kimi K2.5 Instant leads

Kimi K2.5 Instant: 29.7 (#90), Phi-4 Mini: 22.4 (#195)

Reasoning benchmarks
BenchmarkKimi K2.5 InstantPhi-4 Mini
CritPt—0%
LMArena Hard Prompts1443—

Math Not comparable

Kimi K2.5 Instant: 39.4 (#105), Phi-4 Mini: —

Math benchmarks
BenchmarkKimi K2.5 InstantPhi-4 Mini
LMArena Math1442—

Knowledge Kimi K2.5 Instant leads

Kimi K2.5 Instant: 40.2 (#123), Phi-4 Mini: 25.3 (#262)

Knowledge benchmarks
BenchmarkKimi K2.5 InstantPhi-4 Mini
Vectara Hallucination Rate—23.5%
LMArena Expert1440—

Multimodal Not comparable

Kimi K2.5 Instant: 40.2 (#50), Phi-4 Mini: —

Multimodal benchmarks
BenchmarkKimi K2.5 InstantPhi-4 Mini
LMArena Vision1254—

Multilingual Not comparable

Kimi K2.5 Instant: 52.0 (#94), Phi-4 Mini: —

Multilingual benchmarks
BenchmarkKimi K2.5 InstantPhi-4 Mini
LMArena Non-English1406—
LMArena Chinese1449—
LMArena French1403—
LMArena German1413—
LMArena Korean1378—
LMArena Russian1404—
LMArena Spanish1447—

Instruction Following Not comparable

Kimi K2.5 Instant: 75.3 (#65), Phi-4 Mini: —

Instruction Following benchmarks
BenchmarkKimi K2.5 InstantPhi-4 Mini
LMArena Instruction Following1430—

Long Context Not comparable

Kimi K2.5 Instant: 43.9 (#83), Phi-4 Mini: —

Long Context benchmarks
BenchmarkKimi K2.5 InstantPhi-4 Mini
LMArena Longer Query1435—

Writing & Preference Not comparable

Kimi K2.5 Instant: 60.6 (#95), Phi-4 Mini: —

Writing & Preference benchmarks
BenchmarkKimi K2.5 InstantPhi-4 Mini
LMArena Text1420—
LMArena Creative Writing1381—
LMArena Multi-Turn1427—

Frequently asked questions

Is Kimi K2.5 Instant better than Phi-4 Mini?

Kimi K2.5 Instant is the stronger model overall, scoring 43.6 to 30.9 on the Noometry Index.

Is Kimi K2.5 Instant or Phi-4 Mini better for coding?

Kimi K2.5 Instant scores higher on coding benchmarks: 42.6 versus 28.1 in the Noometry coding category.

How many benchmarks do Kimi K2.5 Instant and Phi-4 Mini share?

0 benchmarks have published results for both models. Kimi K2.5 Instant has 18 scored results on Noometry and Phi-4 Mini has 3.

Related comparisons

Go deeper