Model comparison

Kimi K2 Thinking Turbo vs Olmo 7b Instruct

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 30.3 on the Noometry Index.

Last verified . 10 shared benchmarks.

Summary

  • They share 10 benchmarks with published results for both. Kimi K2 Thinking Turbo scores higher in 6 categories and Olmo 7b Instruct in 0 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Kimi K2 Thinking Turbo leads 60.0 to 25.8.

Side by side

Kimi K2 Thinking Turbo and Olmo 7b Instruct specifications
Kimi K2 Thinking TurboOlmo 7b Instruct
ProviderMoonshot AIAllen Institute for AI (Ai2)
Noometry Index45.830.3
Released2025-11-06—
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked2110

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 38.4 (#178), Olmo 7b Instruct: 29.6 (#303)

Coding benchmarks
BenchmarkKimi K2 Thinking TurboOlmo 7b Instruct
LMArena Coding14541016
LMArena WebDev1322—

Reasoning Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 32.5 (#75), Olmo 7b Instruct: 18.8 (#274)

Reasoning benchmarks
BenchmarkKimi K2 Thinking TurboOlmo 7b Instruct
LMArena Hard Prompts1428993
Chess Puzzles20%—

Math Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 47.4 (#68), Olmo 7b Instruct: 30.2 (#237)

Math benchmarks
BenchmarkKimi K2 Thinking TurboOlmo 7b Instruct
LMArena Math14291018
OTIS Mock AIME 2024-202583.1%—

Knowledge Not comparable

Kimi K2 Thinking Turbo: 50.9 (#69), Olmo 7b Instruct: —

Knowledge benchmarks
BenchmarkKimi K2 Thinking TurboOlmo 7b Instruct
GPQA Diamond84.2%—
LMArena Expert1439—

Multilingual Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 51.4 (#109), Olmo 7b Instruct: 24.0 (#291)

Multilingual benchmarks
BenchmarkKimi K2 Thinking TurboOlmo 7b Instruct
LMArena Non-English1398977
LMArena Chinese14561014
LMArena Russian1391947
LMArena French1425—
LMArena German1390—
LMArena Japanese1357—
LMArena Korean1330—
LMArena Spanish1406—

Instruction Following Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 74.0 (#109), Olmo 7b Instruct: 49.0 (#301)

Instruction Following benchmarks
BenchmarkKimi K2 Thinking TurboOlmo 7b Instruct
LMArena Instruction Following1403978

Long Context Not comparable

Kimi K2 Thinking Turbo: 43.2 (#102), Olmo 7b Instruct: —

Long Context benchmarks
BenchmarkKimi K2 Thinking TurboOlmo 7b Instruct
LMArena Longer Query1415—

Writing & Preference Kimi K2 Thinking Turbo leads

Kimi K2 Thinking Turbo: 60.0 (#104), Olmo 7b Instruct: 25.8 (#303)

Writing & Preference benchmarks
BenchmarkKimi K2 Thinking TurboOlmo 7b Instruct
LMArena Text14151032
LMArena Creative Writing1374990
LMArena Multi-Turn14141007

Frequently asked questions

Is Kimi K2 Thinking Turbo better than Olmo 7b Instruct?

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 30.3 on the Noometry Index.

Is Kimi K2 Thinking Turbo or Olmo 7b Instruct better for coding?

Kimi K2 Thinking Turbo scores higher on coding benchmarks: 38.4 versus 29.6 in the Noometry coding category.

How many benchmarks do Kimi K2 Thinking Turbo and Olmo 7b Instruct share?

10 benchmarks have published results for both models. Kimi K2 Thinking Turbo has 21 scored results on Noometry and Olmo 7b Instruct has 10.

Related comparisons

Go deeper