Model comparison

Claude 3.7 Sonnet vs Kimi K2.7 Code

Kimi K2.7 Code is the stronger model overall, scoring 43.3 to 39.5 on the Noometry Index.

Last verified . 4 shared benchmarks.

Claude 3.7 Sonnet Anthropic

39.5

Rank #164 Confirmed

Kimi K2.7 Code Moonshot AI

43.3

Rank #94 Confirmed

Summary

  • They share 4 benchmarks with published results for both. Claude 3.7 Sonnet scores higher in 1 category and Kimi K2.7 Code in 4 categories; 5 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Kimi K2.7 Code leads 39.0 to 18.6.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 57.8% for Claude 3.7 Sonnet and 95.6% for Kimi K2.7 Code.
  • Kimi K2.7 Code has downloadable open weights; the other is API-only.

Side by side

Claude 3.7 Sonnet and Kimi K2.7 Code specifications
Claude 3.7 SonnetKimi K2.7 Code
ProviderAnthropicMoonshot AI
Noometry Index39.543.3
Released2025-02-242026-06-12
WeightsProprietaryOpen
Context window—262K
Max output—262K
Input $ / M tokens—$0.95
Output $ / M tokens—$4
Results tracked5819

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Kimi K2.7 Code leads

Claude 3.7 Sonnet: 40.6 (#136), Kimi K2.7 Code: 42.9 (#95)

Coding benchmarks
BenchmarkClaude 3.7 SonnetKimi K2.7 Code
SWE-bench Verified61%—
DeepSWE—30.5%
FrontierCode—30.1%
SWE-bench Verified (bash only)52.8%—
Aider Polyglot64.9%—
LMArena WebDev—1473
SciCode—47.5%
GSO3.8%—
WeirdML—54.1%
LiveBench Coding74.5%—
LMArena Coding1361—
CadEval54%—
ALE-Bench—886.23

Agentic & Tool Use Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 34.1 (#50), Kimi K2.7 Code: 24.0 (#122)

Agentic & Tool Use benchmarks
BenchmarkClaude 3.7 SonnetKimi K2.7 Code
APEX-Agents—37.6%
TheAgentCompany30.9%—
Cybench20%—
DeepResearch Bench43.6%—
OSWorld35.8%—
GBAEval—0.9%
METR Time Horizons60%—
Vending-Bench 2—5,083

Reasoning Kimi K2.7 Code leads

Claude 3.7 Sonnet: 18.6 (#277), Kimi K2.7 Code: 39.0 (#61)

Reasoning benchmarks
BenchmarkClaude 3.7 SonnetKimi K2.7 Code
SimpleBench46.4%57.9%
Epoch Capabilities Index141.16149.97
ARC-AGI-20.9%—
ARC-AGI-128.6%—
CritPt—10%
Chess Puzzles—21%
EnigmaEval4.2%—
LiveBench Reasoning87.8%—
LMArena Hard Prompts1333—
LiveBench Data Analysis74%—
Surface Evolver Bench—48.8%
ForecastBench61.8—
LiveBench76.1%—

Math Kimi K2.7 Code leads

Claude 3.7 Sonnet: 37.5 (#153), Kimi K2.7 Code: 52.9 (#48)

Math benchmarks
BenchmarkClaude 3.7 SonnetKimi K2.7 Code
OTIS Mock AIME 2024-202557.8%95.6%
FrontierMath (Tiers 1-3)—54%
FrontierMath Tier 4—12.2%
Omni-MATH33%—
LiveBench Math79%—
LMArena Math1337—
MATH Level 591.2%—
FrontierMath (Feb 2025 set)4.1%—

Knowledge Kimi K2.7 Code leads

Claude 3.7 Sonnet: 39.8 (#130), Kimi K2.7 Code: 53.5 (#57)

Knowledge benchmarks
BenchmarkClaude 3.7 SonnetKimi K2.7 Code
GPQA Diamond79.7%87.9%
Humanity's Last Exam8%—
SimpleQA Verified—36.5%
MMLU-Pro78.4%—
Confabulations14.7%—
GPQA (HELM)60.8%—
LMArena Expert1321—

Multimodal Not comparable

Claude 3.7 Sonnet: 33.7 (#95), Kimi K2.7 Code: —

Multimodal benchmarks
BenchmarkClaude 3.7 SonnetKimi K2.7 Code
LMArena Vision1169—
GeoBench68%—
VPCT39%—
SpatialViz-Bench33.9%—

Multilingual Not comparable

Claude 3.7 Sonnet: 44.1 (#179), Kimi K2.7 Code: —

Multilingual benchmarks
BenchmarkClaude 3.7 SonnetKimi K2.7 Code
LMArena Non-English1296—
LMArena Chinese1299—
LMArena French1303—
LMArena German1301—
LMArena Japanese1267—
LMArena Korean1249—
LMArena Russian1311—
LMArena Spanish1298—

Instruction Following Not comparable

Claude 3.7 Sonnet: 72.9 (#125), Kimi K2.7 Code: —

Instruction Following benchmarks
BenchmarkClaude 3.7 SonnetKimi K2.7 Code
LiveBench Instruction Following81.3%—
IFEval83.4%—
LMArena Instruction Following1352—

Long Context Not comparable

Claude 3.7 Sonnet: 50.3 (#10), Kimi K2.7 Code: —

Long Context benchmarks
BenchmarkClaude 3.7 SonnetKimi K2.7 Code
Fiction.LiveBench83.3%—
LMArena Longer Query1373—

Writing & Preference Not comparable

Claude 3.7 Sonnet: 54.4 (#150), Kimi K2.7 Code: —

Writing & Preference benchmarks
BenchmarkClaude 3.7 SonnetKimi K2.7 Code
LMArena Text1314—
LMArena Creative Writing1332—
Short-Story Creative Writing81.1%—
EQ-Bench Creative Writing1412—
WildBench81.4%—
LMArena Multi-Turn1339—
LiveBench Language59.9%—

Frequently asked questions

Is Claude 3.7 Sonnet better than Kimi K2.7 Code?

Kimi K2.7 Code is the stronger model overall, scoring 43.3 to 39.5 on the Noometry Index.

Is Claude 3.7 Sonnet or Kimi K2.7 Code better for coding?

Kimi K2.7 Code scores higher on coding benchmarks: 42.9 versus 40.6 in the Noometry coding category.

How many benchmarks do Claude 3.7 Sonnet and Kimi K2.7 Code share?

4 benchmarks have published results for both models. Claude 3.7 Sonnet has 58 scored results on Noometry and Kimi K2.7 Code has 19.

Related comparisons

Go deeper