Model comparison

Amazon Nova Experimental Chat 10 09 vs Kimi K2 Thinking Turbo

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 41.9 on the Noometry Index.

Last verified . 9 shared benchmarks.

Summary

  • They share 9 benchmarks with published results for both. Amazon Nova Experimental Chat 10 09 scores higher in 1 category and Kimi K2 Thinking Turbo in 5 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Kimi K2 Thinking Turbo leads 60.0 to 54.7.
  • Kimi K2 Thinking Turbo has downloadable open weights; the other is API-only.

Side by side

Amazon Nova Experimental Chat 10 09 and Kimi K2 Thinking Turbo specifications
Amazon Nova Experimental Chat 10 09Kimi K2 Thinking Turbo
ProviderAmazonMoonshot AI
Noometry Index41.945.8
Released—2025-11-06
WeightsProprietaryOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked921

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Amazon Nova Experimental Chat 10 09 leads

Amazon Nova Experimental Chat 10 09: 40.2 (#145), Kimi K2 Thinking Turbo: 38.4 (#178)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Kimi K2 Thinking Turbo
LMArena Coding13701454
LMArena WebDev—1322

Reasoning Kimi K2 Thinking Turbo leads

Amazon Nova Experimental Chat 10 09: 27.3 (#120), Kimi K2 Thinking Turbo: 32.5 (#75)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Kimi K2 Thinking Turbo
LMArena Hard Prompts13561428
Chess Puzzles—20%

Math Not comparable

Amazon Nova Experimental Chat 10 09: —, Kimi K2 Thinking Turbo: 47.4 (#68)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Kimi K2 Thinking Turbo
OTIS Mock AIME 2024-2025—83.1%
LMArena Math—1429

Knowledge Not comparable

Amazon Nova Experimental Chat 10 09: —, Kimi K2 Thinking Turbo: 50.9 (#69)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Kimi K2 Thinking Turbo
GPQA Diamond—84.2%
LMArena Expert—1439

Multilingual Kimi K2 Thinking Turbo leads

Amazon Nova Experimental Chat 10 09: 47.3 (#150), Kimi K2 Thinking Turbo: 51.4 (#109)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Kimi K2 Thinking Turbo
LMArena Non-English13401398
LMArena Chinese13411456
LMArena French—1425
LMArena German—1390
LMArena Japanese—1357
LMArena Korean—1330
LMArena Russian—1391
LMArena Spanish—1406

Instruction Following Kimi K2 Thinking Turbo leads

Amazon Nova Experimental Chat 10 09: 69.4 (#172), Kimi K2 Thinking Turbo: 74.0 (#109)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Kimi K2 Thinking Turbo
LMArena Instruction Following13151403

Long Context Kimi K2 Thinking Turbo leads

Amazon Nova Experimental Chat 10 09: 40.5 (#152), Kimi K2 Thinking Turbo: 43.2 (#102)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Kimi K2 Thinking Turbo
LMArena Longer Query13331415

Writing & Preference Kimi K2 Thinking Turbo leads

Amazon Nova Experimental Chat 10 09: 54.7 (#149), Kimi K2 Thinking Turbo: 60.0 (#104)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 10 09Kimi K2 Thinking Turbo
LMArena Text13641415
LMArena Creative Writing13071374
LMArena Multi-Turn13551414

Frequently asked questions

Is Amazon Nova Experimental Chat 10 09 better than Kimi K2 Thinking Turbo?

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 41.9 on the Noometry Index.

Is Amazon Nova Experimental Chat 10 09 or Kimi K2 Thinking Turbo better for coding?

Amazon Nova Experimental Chat 10 09 scores higher on coding benchmarks: 40.2 versus 38.4 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 10 09 and Kimi K2 Thinking Turbo share?

9 benchmarks have published results for both models. Amazon Nova Experimental Chat 10 09 has 9 scored results on Noometry and Kimi K2 Thinking Turbo has 21.

Related comparisons

Go deeper