Model comparison

Claude 3 Haiku vs Kimi K2 (Jul 2025)

Kimi K2 (Jul 2025) is the stronger model overall, scoring 41.2 to 25.9 on the Noometry Index.

Last verified . 23 shared benchmarks.

Claude 3 Haiku Anthropic

25.9

Rank #340 Confirmed

Kimi K2 (Jul 2025) Moonshot AI

41.2

Rank #140 Confirmed

Summary

  • They share 23 benchmarks with published results for both. Claude 3 Haiku scores higher in 0 categories and Kimi K2 (Jul 2025) in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Kimi K2 (Jul 2025) leads 42.7 to 9.8.
  • The biggest single-benchmark swing is WeirdML: 9.8% for Claude 3 Haiku and 42.8% for Kimi K2 (Jul 2025).
  • Kimi K2 (Jul 2025) has downloadable open weights; the other is API-only.

Side by side

Claude 3 Haiku and Kimi K2 (Jul 2025) specifications
Claude 3 HaikuKimi K2 (Jul 2025)
ProviderAnthropicMoonshot AI
Noometry Index25.941.2
Released2024-03-072025-07-12
WeightsProprietaryOpen
Context window—262K
Max output—262K
Input $ / M tokens—$0.57
Output $ / M tokens—$2.30
Results tracked3742

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Kimi K2 (Jul 2025) leads

Claude 3 Haiku: 26.4 (#325), Kimi K2 (Jul 2025): 42.4 (#102)

Coding benchmarks
BenchmarkClaude 3 HaikuKimi K2 (Jul 2025)
WeirdML9.8%42.8%
LMArena Coding11991399
SWE-bench Verified (bash only)—63.4%
Aider Polyglot—59.1%
GSO—4.9%
BigCodeBench Instruct39.4%—
BigCodeBench Complete50.1%—
CadEval12%—
ALE-Bench—597.5
HumanEval+68.9%—
MBPP+68.8%—

Agentic & Tool Use Not comparable

Claude 3 Haiku: —, Kimi K2 (Jul 2025): 32.4 (#64)

Agentic & Tool Use benchmarks
BenchmarkClaude 3 HaikuKimi K2 (Jul 2025)
Terminal-Bench—35.7%
Berkeley Function Calling Leaderboard—59.1%
METR Time Horizons—59.2%

Reasoning Kimi K2 (Jul 2025) leads

Claude 3 Haiku: 16.3 (#307), Kimi K2 (Jul 2025): 23.3 (#179)

Reasoning benchmarks
BenchmarkClaude 3 HaikuKimi K2 (Jul 2025)
Kagi LLM Benchmark34.2%64.4%
LMArena Hard Prompts11741384
Epoch Capabilities Index118.35146.01
ForecastBench53.260.2
SimpleBench—26.3%
DTBench50.1%—
LMCA8.8%—
WinoGrande74.2%—

Math Kimi K2 (Jul 2025) leads

Claude 3 Haiku: 9.8 (#319), Kimi K2 (Jul 2025): 42.7 (#83)

Math benchmarks
BenchmarkClaude 3 HaikuKimi K2 (Jul 2025)
LMArena Math11881397
OTIS Mock AIME 2024-20251.8%—
Omni-MATH—65.4%
MATH Level 514.9%—
FrontierMath (Feb 2025 set)—21.4%
FrontierMath Tier 4 (v1)—0%

Knowledge Kimi K2 (Jul 2025) leads

Claude 3 Haiku: 17.3 (#285), Kimi K2 (Jul 2025): 37.3 (#157)

Knowledge benchmarks
BenchmarkClaude 3 HaikuKimi K2 (Jul 2025)
Confabulations34.2%20.4%
LMArena Expert11481365
GPQA Diamond36.3%—
MMLU-Pro—81.9%
Vectara Hallucination Rate—17.9%
GPQA (HELM)—65.3%
MMLU73.8%—

Multimodal Not comparable

Claude 3 Haiku: 23.6 (#128), Kimi K2 (Jul 2025): —

Multimodal benchmarks
BenchmarkClaude 3 HaikuKimi K2 (Jul 2025)
LMArena Vision950—
ScienceQA72%—

Multilingual Kimi K2 (Jul 2025) leads

Claude 3 Haiku: 36.0 (#243), Kimi K2 (Jul 2025): 49.6 (#130)

Multilingual benchmarks
BenchmarkClaude 3 HaikuKimi K2 (Jul 2025)
LMArena Non-English11781372
LMArena Chinese11551415
LMArena French11951379
LMArena German11741387
LMArena Japanese11021349
LMArena Korean11091325
LMArena Russian12041385
LMArena Spanish11661386

Instruction Following Kimi K2 (Jul 2025) leads

Claude 3 Haiku: 61.3 (#247), Kimi K2 (Jul 2025): 71.1 (#156)

Instruction Following benchmarks
BenchmarkClaude 3 HaikuKimi K2 (Jul 2025)
LMArena Instruction Following11731348
IFEval—85%

Long Context Kimi K2 (Jul 2025) leads

Claude 3 Haiku: 36.1 (#237), Kimi K2 (Jul 2025): 41.2 (#145)

Long Context benchmarks
BenchmarkClaude 3 HaikuKimi K2 (Jul 2025)
LMArena Longer Query11901353
Fiction.LiveBench—66.7%
CL-bench—17.6%

Writing & Preference Kimi K2 (Jul 2025) leads

Claude 3 Haiku: 29.7 (#291), Kimi K2 (Jul 2025): 62.3 (#78)

Writing & Preference benchmarks
BenchmarkClaude 3 HaikuKimi K2 (Jul 2025)
LMArena Text11951380
LMArena Creative Writing11571350
EQ-Bench Creative Writing7171666
LMArena Multi-Turn11901371
Short-Story Creative Writing—85.6%
WildBench—86.2%

Frequently asked questions

Is Claude 3 Haiku better than Kimi K2 (Jul 2025)?

Kimi K2 (Jul 2025) is the stronger model overall, scoring 41.2 to 25.9 on the Noometry Index.

Is Claude 3 Haiku or Kimi K2 (Jul 2025) better for coding?

Kimi K2 (Jul 2025) scores higher on coding benchmarks: 42.4 versus 26.4 in the Noometry coding category.

How many benchmarks do Claude 3 Haiku and Kimi K2 (Jul 2025) share?

23 benchmarks have published results for both models. Claude 3 Haiku has 37 scored results on Noometry and Kimi K2 (Jul 2025) has 42.

Related comparisons

Go deeper