Model comparison

Gemini 2.0 Flash-Lite vs Kimi K2 (Jul 2025)

Kimi K2 (Jul 2025) is the stronger model overall, scoring 41.2 to 37.8 on the Noometry Index.

Last verified . 23 shared benchmarks.

Gemini 2.0 Flash-Lite Google

37.8

Rank #194 Confirmed

Kimi K2 (Jul 2025) Moonshot AI

41.2

Rank #140 Confirmed

Summary

  • They share 23 benchmarks with published results for both. Gemini 2.0 Flash-Lite scores higher in 0 categories and Kimi K2 (Jul 2025) in 8 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Kimi K2 (Jul 2025) leads 62.3 to 51.7.
  • The biggest single-benchmark swing is Omni-MATH: 37.4% for Gemini 2.0 Flash-Lite and 65.4% for Kimi K2 (Jul 2025).
  • Kimi K2 (Jul 2025) has downloadable open weights; the other is API-only.

Side by side

Gemini 2.0 Flash-Lite and Kimi K2 (Jul 2025) specifications
Gemini 2.0 Flash-LiteKimi K2 (Jul 2025)
ProviderGoogleMoonshot AI
Noometry Index37.841.2
Released2025-02-052025-07-12
WeightsProprietaryOpen
Context window—262K
Max output—262K
Input $ / M tokens—$0.57
Output $ / M tokens—$2.30
Results tracked3242

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Kimi K2 (Jul 2025) leads

Gemini 2.0 Flash-Lite: 37.9 (#185), Kimi K2 (Jul 2025): 42.4 (#102)

Coding benchmarks
BenchmarkGemini 2.0 Flash-LiteKimi K2 (Jul 2025)
LMArena Coding13221399
SWE-bench Verified (bash only)—63.4%
Aider Polyglot—59.1%
GSO—4.9%
WeirdML—42.8%
LiveBench Coding47.1%—
ALE-Bench—597.5

Agentic & Tool Use Not comparable

Gemini 2.0 Flash-Lite: —, Kimi K2 (Jul 2025): 32.4 (#64)

Agentic & Tool Use benchmarks
BenchmarkGemini 2.0 Flash-LiteKimi K2 (Jul 2025)
Terminal-Bench—35.7%
Berkeley Function Calling Leaderboard—59.1%
METR Time Horizons—59.2%

Reasoning Kimi K2 (Jul 2025) leads

Gemini 2.0 Flash-Lite: 22.0 (#210), Kimi K2 (Jul 2025): 23.3 (#179)

Reasoning benchmarks
BenchmarkGemini 2.0 Flash-LiteKimi K2 (Jul 2025)
LMArena Hard Prompts13241384
ForecastBench57.160.2
SimpleBench—26.3%
Kagi LLM Benchmark—64.4%
LiveBench Reasoning50.1%—
DTBench52.5%—
LiveBench Data Analysis65.5%—
Epoch Capabilities Index—146.01
LiveBench54.3%—

Math Kimi K2 (Jul 2025) leads

Gemini 2.0 Flash-Lite: 34.1 (#196), Kimi K2 (Jul 2025): 42.7 (#83)

Math benchmarks
BenchmarkGemini 2.0 Flash-LiteKimi K2 (Jul 2025)
Omni-MATH37.4%65.4%
LMArena Math13091397
LiveBench Math58.1%—
FrontierMath (Feb 2025 set)—21.4%
FrontierMath Tier 4 (v1)—0%

Knowledge Kimi K2 (Jul 2025) leads

Gemini 2.0 Flash-Lite: 35.0 (#189), Kimi K2 (Jul 2025): 37.3 (#157)

Knowledge benchmarks
BenchmarkGemini 2.0 Flash-LiteKimi K2 (Jul 2025)
MMLU-Pro72%81.9%
GPQA (HELM)50%65.3%
LMArena Expert13051365
Confabulations—20.4%
Vectara Hallucination Rate—17.9%

Multimodal Not comparable

Gemini 2.0 Flash-Lite: 31.2 (#109), Kimi K2 (Jul 2025): —

Multimodal benchmarks
BenchmarkGemini 2.0 Flash-LiteKimi K2 (Jul 2025)
LMArena Vision1100—

Multilingual Kimi K2 (Jul 2025) leads

Gemini 2.0 Flash-Lite: 46.0 (#161), Kimi K2 (Jul 2025): 49.6 (#130)

Multilingual benchmarks
BenchmarkGemini 2.0 Flash-LiteKimi K2 (Jul 2025)
LMArena Non-English13231372
LMArena Chinese13391415
LMArena French13471379
LMArena German13061387
LMArena Japanese13011349
LMArena Korean13251325
LMArena Russian13281385
LMArena Spanish13131386

Instruction Following Too close to call

Gemini 2.0 Flash-Lite: 70.4 (#163), Kimi K2 (Jul 2025): 71.1 (#156)

Instruction Following benchmarks
BenchmarkGemini 2.0 Flash-LiteKimi K2 (Jul 2025)
IFEval82.4%85%
LMArena Instruction Following13051348
LiveBench Instruction Following78.3%—

Long Context Kimi K2 (Jul 2025) leads

Gemini 2.0 Flash-Lite: 40.1 (#160), Kimi K2 (Jul 2025): 41.2 (#145)

Long Context benchmarks
BenchmarkGemini 2.0 Flash-LiteKimi K2 (Jul 2025)
LMArena Longer Query13201353
Fiction.LiveBench—66.7%
CL-bench—17.6%

Writing & Preference Kimi K2 (Jul 2025) leads

Gemini 2.0 Flash-Lite: 51.7 (#177), Kimi K2 (Jul 2025): 62.3 (#78)

Writing & Preference benchmarks
BenchmarkGemini 2.0 Flash-LiteKimi K2 (Jul 2025)
LMArena Text13301380
LMArena Creative Writing13191350
WildBench79%86.2%
LMArena Multi-Turn13071371
Short-Story Creative Writing—85.6%
EQ-Bench Creative Writing—1666
LiveBench Language34.3%—

Frequently asked questions

Is Gemini 2.0 Flash-Lite better than Kimi K2 (Jul 2025)?

Kimi K2 (Jul 2025) is the stronger model overall, scoring 41.2 to 37.8 on the Noometry Index.

Is Gemini 2.0 Flash-Lite or Kimi K2 (Jul 2025) better for coding?

Kimi K2 (Jul 2025) scores higher on coding benchmarks: 42.4 versus 37.9 in the Noometry coding category.

How many benchmarks do Gemini 2.0 Flash-Lite and Kimi K2 (Jul 2025) share?

23 benchmarks have published results for both models. Gemini 2.0 Flash-Lite has 32 scored results on Noometry and Kimi K2 (Jul 2025) has 42.

Related comparisons

Go deeper