Model comparison

Claude Sonnet 4 vs Kimi K2 Thinking Turbo

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 40.8 on the Noometry Index.

Last verified . 19 shared benchmarks.

Claude Sonnet 4 Anthropic

40.8

Rank #145 Confirmed

Kimi K2 Thinking Turbo Moonshot AI

45.8

Rank #70 Confirmed

Summary

  • They share 19 benchmarks with published results for both. Claude Sonnet 4 scores higher in 1 category and Kimi K2 Thinking Turbo in 7 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in long context, where Kimi K2 Thinking Turbo leads 43.2 to 33.7.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 71.1% for Claude Sonnet 4 and 83.1% for Kimi K2 Thinking Turbo.
  • Kimi K2 Thinking Turbo has downloadable open weights; the other is API-only.

Side by side

Claude Sonnet 4 and Kimi K2 Thinking Turbo specifications
Claude Sonnet 4Kimi K2 Thinking Turbo
ProviderAnthropicMoonshot AI
Noometry Index40.845.8
Released2025-05-222025-11-06
WeightsProprietaryOpen
Context window200K—
Max output64K—
Input $ / M tokens$3—
Output $ / M tokens$15—
Results tracked5821

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 4 leads

Claude Sonnet 4: 43.5 (#88), Kimi K2 Thinking Turbo: 38.4 (#178)

Coding benchmarks
BenchmarkClaude Sonnet 4Kimi K2 Thinking Turbo
LMArena Coding14141454
SWE-bench Verified (bash only)64.9%—
Aider Polyglot61.3%—
LMArena WebDev—1322
SciCode40%—
GSO4.9%—
WeirdML46.1%—
ALE-Bench655.35—

Agentic & Tool Use Not comparable

Claude Sonnet 4: 38.5 (#31), Kimi K2 Thinking Turbo: —

Agentic & Tool Use benchmarks
BenchmarkClaude Sonnet 4Kimi K2 Thinking Turbo
TheAgentCompany33.1%—
Cybench35%—
DeepResearch Bench46.6%—
OSWorld43.9%—
METR Time Horizons62%—

Reasoning Kimi K2 Thinking Turbo leads

Claude Sonnet 4: 22.9 (#187), Kimi K2 Thinking Turbo: 32.5 (#75)

Reasoning benchmarks
BenchmarkClaude Sonnet 4Kimi K2 Thinking Turbo
LMArena Hard Prompts13721428
ARC-AGI-25.9%—
SimpleBench45.5%—
Kagi LLM Benchmark73%—
ARC-AGI-140%—
CritPt0.3%—
Chess Puzzles—20%
EnigmaEval3.1%—
DTBench77.1%—
LMCA29%—
Epoch Capabilities Index141.69—
ForecastBench60.2—

Math Kimi K2 Thinking Turbo leads

Claude Sonnet 4: 43.3 (#80), Kimi K2 Thinking Turbo: 47.4 (#68)

Math benchmarks
BenchmarkClaude Sonnet 4Kimi K2 Thinking Turbo
OTIS Mock AIME 2024-202571.1%83.1%
LMArena Math13751429
Omni-MATH60.2%—
MATH Level 584.4%—
FrontierMath (Feb 2025 set)4.1%—
FrontierMath Tier 4 (v1)0%—

Knowledge Kimi K2 Thinking Turbo leads

Claude Sonnet 4: 41.8 (#108), Kimi K2 Thinking Turbo: 50.9 (#69)

Knowledge benchmarks
BenchmarkClaude Sonnet 4Kimi K2 Thinking Turbo
GPQA Diamond79.2%84.2%
LMArena Expert13721439
Humanity's Last Exam7.8%—
MMLU-Pro84.3%—
Confabulations13.2%—
Vectara Hallucination Rate10.3%—
GPQA (HELM)70.6%—

Multimodal Not comparable

Claude Sonnet 4: 26.2 (#121), Kimi K2 Thinking Turbo: —

Multimodal benchmarks
BenchmarkClaude Sonnet 4Kimi K2 Thinking Turbo
LMArena Vision1191—
GeoBench37%—
VPCT34%—
MindCube44.8%—

Multilingual Kimi K2 Thinking Turbo leads

Claude Sonnet 4: 46.7 (#156), Kimi K2 Thinking Turbo: 51.4 (#109)

Multilingual benchmarks
BenchmarkClaude Sonnet 4Kimi K2 Thinking Turbo
LMArena Non-English13331398
LMArena Chinese13501456
LMArena French13631425
LMArena German13311390
LMArena Japanese13021357
LMArena Korean12911330
LMArena Russian13551391
LMArena Spanish13571406

Instruction Following Kimi K2 Thinking Turbo leads

Claude Sonnet 4: 71.7 (#145), Kimi K2 Thinking Turbo: 74.0 (#109)

Instruction Following benchmarks
BenchmarkClaude Sonnet 4Kimi K2 Thinking Turbo
LMArena Instruction Following13761403
IFEval84%—

Long Context Kimi K2 Thinking Turbo leads

Claude Sonnet 4: 33.7 (#259), Kimi K2 Thinking Turbo: 43.2 (#102)

Long Context benchmarks
BenchmarkClaude Sonnet 4Kimi K2 Thinking Turbo
LMArena Longer Query13981415
Fiction.LiveBench46.9%—

Writing & Preference Kimi K2 Thinking Turbo leads

Claude Sonnet 4: 57.1 (#132), Kimi K2 Thinking Turbo: 60.0 (#104)

Writing & Preference benchmarks
BenchmarkClaude Sonnet 4Kimi K2 Thinking Turbo
LMArena Text13511415
LMArena Creative Writing13451374
LMArena Multi-Turn13761414
Short-Story Creative Writing81.4%—
EQ-Bench Creative Writing1483—
WildBench83.8%—

Frequently asked questions

Is Claude Sonnet 4 better than Kimi K2 Thinking Turbo?

Kimi K2 Thinking Turbo is the stronger model overall, scoring 45.8 to 40.8 on the Noometry Index.

Is Claude Sonnet 4 or Kimi K2 Thinking Turbo better for coding?

Claude Sonnet 4 scores higher on coding benchmarks: 43.5 versus 38.4 in the Noometry coding category.

How many benchmarks do Claude Sonnet 4 and Kimi K2 Thinking Turbo share?

19 benchmarks have published results for both models. Claude Sonnet 4 has 58 scored results on Noometry and Kimi K2 Thinking Turbo has 21.

Related comparisons

Go deeper