Model comparison

Gemma 4 26B A4B IT vs Kimi K2 Thinking Turbo

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 43.5 on the Noometry Index.

Last verified . 18 shared benchmarks.

Gemma 4 26B A4B IT Google

43.5

Rank #92 Confirmed

Kimi K2 Thinking Turbo Moonshot AI

45.8

Rank #70 Confirmed

Summary

  • They share 18 benchmarks with published results for both. Gemma 4 26B A4B IT scores higher in 5 categories and Kimi K2 Thinking Turbo in 3 categories; 4 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Kimi K2 Thinking Turbo leads 32.5 to 21.8.
  • The biggest single-benchmark swing is Chess Puzzles: 6% for Gemma 4 26B A4B IT and 20% for Kimi K2 Thinking Turbo.

Side by side

Gemma 4 26B A4B IT and Kimi K2 Thinking Turbo specifications
Gemma 4 26B A4B ITKimi K2 Thinking Turbo
ProviderGoogleMoonshot AI
Noometry Index43.545.8
Released2026-04-022025-11-06
WeightsOpenOpen
Context window262K—
Max output33K—
Input $ / M tokens$0.0675—
Output $ / M tokens$0.23—
Results tracked2821

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

Gemma 4 26B A4B IT: 39.0 (#164), Kimi K2 Thinking Turbo: 38.4 (#178)

Coding benchmarks
BenchmarkGemma 4 26B A4B ITKimi K2 Thinking Turbo
LMArena WebDev13591322
LMArena Coding14471454
SciCode40%—
WeirdML35.2%—
ALE-Bench927.17—

Reasoning Kimi K2 Thinking Turbo leads

Gemma 4 26B A4B IT: 21.8 (#213), Kimi K2 Thinking Turbo: 32.5 (#75)

Reasoning benchmarks
BenchmarkGemma 4 26B A4B ITKimi K2 Thinking Turbo
Chess Puzzles6%20%
LMArena Hard Prompts14391428
CritPt0%—
DTBench74.9%—
LMCA29.7%—
Epoch Capabilities Index141.85—

Math Too close to call

Gemma 4 26B A4B IT: 47.6 (#67), Kimi K2 Thinking Turbo: 47.4 (#68)

Math benchmarks
BenchmarkGemma 4 26B A4B ITKimi K2 Thinking Turbo
OTIS Mock AIME 2024-202582.2%83.1%
LMArena Math14701429

Knowledge Kimi K2 Thinking Turbo leads

Gemma 4 26B A4B IT: 45.7 (#85), Kimi K2 Thinking Turbo: 50.9 (#69)

Knowledge benchmarks
BenchmarkGemma 4 26B A4B ITKimi K2 Thinking Turbo
GPQA Diamond73.2%84.2%
LMArena Expert14471439
Vectara Hallucination Rate5.2%—

Multimodal Not comparable

Gemma 4 26B A4B IT: 40.6 (#46), Kimi K2 Thinking Turbo: —

Multimodal benchmarks
BenchmarkGemma 4 26B A4B ITKimi K2 Thinking Turbo
LMArena Vision1260—

Multilingual Gemma 4 26B A4B IT leads

Gemma 4 26B A4B IT: 53.1 (#71), Kimi K2 Thinking Turbo: 51.4 (#109)

Multilingual benchmarks
BenchmarkGemma 4 26B A4B ITKimi K2 Thinking Turbo
LMArena Non-English14211398
LMArena Chinese14951456
LMArena French14601425
LMArena Russian14341391
LMArena Spanish14171406
LMArena German—1390
LMArena Japanese—1357
LMArena Korean—1330

Instruction Following Too close to call

Gemma 4 26B A4B IT: 74.8 (#82), Kimi K2 Thinking Turbo: 74.0 (#109)

Instruction Following benchmarks
BenchmarkGemma 4 26B A4B ITKimi K2 Thinking Turbo
LMArena Instruction Following14201403

Long Context Too close to call

Gemma 4 26B A4B IT: 43.6 (#91), Kimi K2 Thinking Turbo: 43.2 (#102)

Long Context benchmarks
BenchmarkGemma 4 26B A4B ITKimi K2 Thinking Turbo
LMArena Longer Query14281415

Writing & Preference Kimi K2 Thinking Turbo leads

Gemma 4 26B A4B IT: 58.6 (#115), Kimi K2 Thinking Turbo: 60.0 (#104)

Writing & Preference benchmarks
BenchmarkGemma 4 26B A4B ITKimi K2 Thinking Turbo
LMArena Text14341415
LMArena Creative Writing14021374
LMArena Multi-Turn14411414
EQ-Bench Creative Writing1305—

Frequently asked questions

Is Gemma 4 26B A4B IT better than Kimi K2 Thinking Turbo?

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 43.5 on the Noometry Index.

Is Gemma 4 26B A4B IT or Kimi K2 Thinking Turbo better for coding?

They score almost the same on coding (39.0 vs 38.4); test both on your own repository before choosing.

How many benchmarks do Gemma 4 26B A4B IT and Kimi K2 Thinking Turbo share?

18 benchmarks have published results for both models. Gemma 4 26B A4B IT has 28 scored results on Noometry and Kimi K2 Thinking Turbo has 21.

Related comparisons

Go deeper