Model comparison

Claude 3.5 Haiku vs Kimi K2.7 Code

Kimi K2.7 Code is the stronger model overall, scoring 43.3 to 29.2 on the Noometry Index.

Last verified . 6 shared benchmarks.

Claude 3.5 Haiku Anthropic

29.2

Rank #315 Confirmed

Kimi K2.7 Code Moonshot AI

43.3

Rank #94 Confirmed

Summary

  • They share 6 benchmarks with published results for both. Claude 3.5 Haiku scores higher in 1 category and Kimi K2.7 Code in 4 categories; 5 gaps are clear of the uncertainty.
  • The widest gap is in math, where Kimi K2.7 Code leads 52.9 to 14.7.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 4.3% for Claude 3.5 Haiku and 95.6% for Kimi K2.7 Code.
  • Kimi K2.7 Code has downloadable open weights; the other is API-only.

Side by side

Claude 3.5 Haiku and Kimi K2.7 Code specifications
Claude 3.5 HaikuKimi K2.7 Code
ProviderAnthropicMoonshot AI
Noometry Index29.243.3
Released2024-10-222026-06-12
WeightsProprietaryOpen
Context window—262K
Max output—262K
Input $ / M tokens—$0.95
Output $ / M tokens—$4
Results tracked4919

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Kimi K2.7 Code leads

Claude 3.5 Haiku: 32.9 (#265), Kimi K2.7 Code: 42.9 (#95)

Coding benchmarks
BenchmarkClaude 3.5 HaikuKimi K2.7 Code
SciCode27.4%47.5%
WeirdML30.7%54.1%
DeepSWE—30.5%
FrontierCode—30.1%
Aider Polyglot28%—
LMArena WebDev—1473
BigCodeBench Instruct46.1%—
LiveBench Coding51.4%—
LMArena Coding1286—
BigCodeBench Complete59%—
CadEval32%—
ALE-Bench—886.23

Agentic & Tool Use Claude 3.5 Haiku leads

Claude 3.5 Haiku: 28.0 (#95), Kimi K2.7 Code: 24.0 (#122)

Agentic & Tool Use benchmarks
BenchmarkClaude 3.5 HaikuKimi K2.7 Code
APEX-Agents—37.6%
BALROG19.3%—
GBAEval—0.9%
Vending-Bench 2—5,083

Reasoning Kimi K2.7 Code leads

Claude 3.5 Haiku: 17.7 (#290), Kimi K2.7 Code: 39.0 (#61)

Reasoning benchmarks
BenchmarkClaude 3.5 HaikuKimi K2.7 Code
CritPt0%10%
Epoch Capabilities Index127.15149.97
SimpleBench—57.9%
Chess Puzzles—21%
LiveBench Reasoning28.1%—
LMArena Hard Prompts1251—
DTBench56.7%—
LiveBench Data Analysis48.5%—
Surface Evolver Bench—48.8%
LiveBench43.5%—

Math Kimi K2.7 Code leads

Claude 3.5 Haiku: 14.7 (#300), Kimi K2.7 Code: 52.9 (#48)

Math benchmarks
BenchmarkClaude 3.5 HaikuKimi K2.7 Code
OTIS Mock AIME 2024-20254.3%95.6%
FrontierMath (Tiers 1-3)—54%
FrontierMath Tier 4—12.2%
Omni-MATH22.4%—
LiveBench Math35.5%—
LMArena Math1244—
MATH Level 546.4%—
FrontierMath (Feb 2025 set)0.3%—

Knowledge Kimi K2.7 Code leads

Claude 3.5 Haiku: 18.7 (#281), Kimi K2.7 Code: 53.5 (#57)

Knowledge benchmarks
BenchmarkClaude 3.5 HaikuKimi K2.7 Code
GPQA Diamond38.1%87.9%
SimpleQA Verified—36.5%
MMLU-Pro60.5%—
Confabulations36.7%—
GPQA (HELM)36.3%—
LMArena Expert1208—
MMLU74.3%—

Multimodal Not comparable

Claude 3.5 Haiku: 26.8 (#117), Kimi K2.7 Code: —

Multimodal benchmarks
BenchmarkClaude 3.5 HaikuKimi K2.7 Code
LMArena Vision1092—
GeoBench34%—

Multilingual Not comparable

Claude 3.5 Haiku: 40.0 (#218), Kimi K2.7 Code: —

Multilingual benchmarks
BenchmarkClaude 3.5 HaikuKimi K2.7 Code
LMArena Non-English1238—
LMArena Chinese1229—
LMArena French1264—
LMArena German1237—
LMArena Japanese1175—
LMArena Korean1173—
LMArena Russian1253—
LMArena Spanish1261—

Instruction Following Not comparable

Claude 3.5 Haiku: 62.9 (#234), Kimi K2.7 Code: —

Instruction Following benchmarks
BenchmarkClaude 3.5 HaikuKimi K2.7 Code
LiveBench Instruction Following61.9%—
IFEval79.2%—
LMArena Instruction Following1241—

Long Context Not comparable

Claude 3.5 Haiku: 38.3 (#200), Kimi K2.7 Code: —

Long Context benchmarks
BenchmarkClaude 3.5 HaikuKimi K2.7 Code
LMArena Longer Query1261—

Writing & Preference Not comparable

Claude 3.5 Haiku: 42.7 (#234), Kimi K2.7 Code: —

Writing & Preference benchmarks
BenchmarkClaude 3.5 HaikuKimi K2.7 Code
LMArena Text1255—
LMArena Creative Writing1233—
Short-Story Creative Writing73.5%—
EQ-Bench Creative Writing1146—
WildBench76%—
LMArena Multi-Turn1265—
LiveBench Language35.4%—

Frequently asked questions

Is Claude 3.5 Haiku better than Kimi K2.7 Code?

Kimi K2.7 Code is the stronger model overall, scoring 43.3 to 29.2 on the Noometry Index.

Is Claude 3.5 Haiku or Kimi K2.7 Code better for coding?

Kimi K2.7 Code scores higher on coding benchmarks: 42.9 versus 32.9 in the Noometry coding category.

How many benchmarks do Claude 3.5 Haiku and Kimi K2.7 Code share?

6 benchmarks have published results for both models. Claude 3.5 Haiku has 49 scored results on Noometry and Kimi K2.7 Code has 19.

Related comparisons

Go deeper