Model comparison

Claude Haiku 4.5 vs Gemma 3n E4b IT

Claude Haiku 4.5 is the stronger model overall, scoring 39.5 to 37.3 on the Noometry Index.

Last verified . 17 shared benchmarks.

Claude Haiku 4.5 Anthropic

39.5

Rank #165 Confirmed

Gemma 3n E4b IT Google

37.3

Rank #206 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Claude Haiku 4.5 scores higher in 7 categories and Gemma 3n E4b IT in 1 category; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Claude Haiku 4.5 leads 44.9 to 35.1.
  • Gemma 3n E4b IT has downloadable open weights; the other is API-only.

Side by side

Claude Haiku 4.5 and Gemma 3n E4b IT specifications
Claude Haiku 4.5Gemma 3n E4b IT
ProviderAnthropicGoogle
Noometry Index39.537.3
Released2025-10-15—
WeightsProprietaryOpen
Context window200K—
Max output64K—
Input $ / M tokens$1—
Output $ / M tokens$5—
Results tracked5318

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Haiku 4.5 leads

Claude Haiku 4.5: 44.0 (#78), Gemma 3n E4b IT: 37.0 (#198)

Coding benchmarks
BenchmarkClaude Haiku 4.5Gemma 3n E4b IT
LMArena Coding14531268
SWE-bench Verified (bash only)66.6%—
LMArena WebDev1330—
SWE-bench Multilingual64.7%—
SciCode43.3%—
WeirdML45.4%—
ALE-Bench653.48—

Agentic & Tool Use Not comparable

Claude Haiku 4.5: 33.6 (#52), Gemma 3n E4b IT: —

Agentic & Tool Use benchmarks
BenchmarkClaude Haiku 4.5Gemma 3n E4b IT
Terminal-Bench35.5%—
Berkeley Function Calling Leaderboard68.7%—
DeepResearch Bench45.5%—
BALROG31.2%—
ExploitBench13.7%—
Vending-Bench 2458.89—

Reasoning Gemma 3n E4b IT leads

Claude Haiku 4.5: 15.1 (#320), Gemma 3n E4b IT: 19.9 (#247)

Reasoning benchmarks
BenchmarkClaude Haiku 4.5Gemma 3n E4b IT
LMArena Hard Prompts14201284
ARC-AGI-24%—
Kagi LLM Benchmark—31.5%
NYT Connections (extended)14.3%—
ARC-AGI-147.7%—
CritPt0%—
Chess Puzzles8%—
DTBench73.6%—
LMCA30.9%—
Epoch Capabilities Index142.41—
ForecastBench61.4—

Math Claude Haiku 4.5 leads

Claude Haiku 4.5: 44.9 (#78), Gemma 3n E4b IT: 35.1 (#188)

Math benchmarks
BenchmarkClaude Haiku 4.5Gemma 3n E4b IT
LMArena Math13961251
OTIS Mock AIME 2024-202566.7%—
Omni-MATH56.1%—
MATH Level 596.4%—
FrontierMath (Feb 2025 set)5.9%—
FrontierMath Tier 4 (v1)2.1%—

Knowledge Claude Haiku 4.5 leads

Claude Haiku 4.5: 37.7 (#153), Gemma 3n E4b IT: 34.2 (#198)

Knowledge benchmarks
BenchmarkClaude Haiku 4.5Gemma 3n E4b IT
LMArena Expert14421246
GPQA Diamond71.2%—
SimpleQA Verified13.2%—
MMLU-Pro77.7%—
Vectara Hallucination Rate9.8%—
GPQA (HELM)60.5%—

Multimodal Not comparable

Claude Haiku 4.5: 26.8 (#118), Gemma 3n E4b IT: —

Multimodal benchmarks
BenchmarkClaude Haiku 4.5Gemma 3n E4b IT
Blueprint-Bench 20%—
LMArena Document1420—

Multilingual Claude Haiku 4.5 leads

Claude Haiku 4.5: 49.9 (#129), Gemma 3n E4b IT: 43.4 (#183)

Multilingual benchmarks
BenchmarkClaude Haiku 4.5Gemma 3n E4b IT
LMArena Non-English13771285
LMArena Chinese14171309
LMArena French14081330
LMArena German13751311
LMArena Japanese13391272
LMArena Korean13471259
LMArena Russian13811288
LMArena Spanish14201305

Instruction Following Claude Haiku 4.5 leads

Claude Haiku 4.5: 71.4 (#149), Gemma 3n E4b IT: 66.1 (#210)

Instruction Following benchmarks
BenchmarkClaude Haiku 4.5Gemma 3n E4b IT
LMArena Instruction Following14141255
IFEval80.1%—

Long Context Claude Haiku 4.5 leads

Claude Haiku 4.5: 43.6 (#92), Gemma 3n E4b IT: 38.7 (#191)

Long Context benchmarks
BenchmarkClaude Haiku 4.5Gemma 3n E4b IT
LMArena Longer Query14271276

Writing & Preference Claude Haiku 4.5 leads

Claude Haiku 4.5: 57.9 (#123), Gemma 3n E4b IT: 50.1 (#186)

Writing & Preference benchmarks
BenchmarkClaude Haiku 4.5Gemma 3n E4b IT
LMArena Text13961306
LMArena Creative Writing13721287
LMArena Multi-Turn14091276
WildBench83.9%—
EQ-Bench 41064—

Frequently asked questions

Is Claude Haiku 4.5 better than Gemma 3n E4b IT?

Claude Haiku 4.5 is the stronger model overall, scoring 39.5 to 37.3 on the Noometry Index.

Is Claude Haiku 4.5 or Gemma 3n E4b IT better for coding?

Claude Haiku 4.5 scores higher on coding benchmarks: 44.0 versus 37.0 in the Noometry coding category.

How many benchmarks do Claude Haiku 4.5 and Gemma 3n E4b IT share?

17 benchmarks have published results for both models. Claude Haiku 4.5 has 53 scored results on Noometry and Gemma 3n E4b IT has 18.

Related comparisons

Go deeper