Model comparison

Claude 3.7 Sonnet vs Gemma 3n E4b IT

Claude 3.7 Sonnet is the stronger model overall, scoring 39.5 to 37.3 on the Noometry Index.

Last verified . 17 shared benchmarks.

Claude 3.7 Sonnet Anthropic

39.5

Rank #164 Confirmed

Gemma 3n E4b IT Google

37.3

Rank #206 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Claude 3.7 Sonnet scores higher in 7 categories and Gemma 3n E4b IT in 1 category; 7 gaps are clear of the uncertainty.
  • The widest gap is in long context, where Claude 3.7 Sonnet leads 50.3 to 38.7.
  • Gemma 3n E4b IT has downloadable open weights; the other is API-only.

Side by side

Claude 3.7 Sonnet and Gemma 3n E4b IT specifications
Claude 3.7 SonnetGemma 3n E4b IT
ProviderAnthropicGoogle
Noometry Index39.537.3
Released2025-02-24—
WeightsProprietaryOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked5818

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 40.6 (#136), Gemma 3n E4b IT: 37.0 (#198)

Coding benchmarks
BenchmarkClaude 3.7 SonnetGemma 3n E4b IT
LMArena Coding13611268
SWE-bench Verified61%—
SWE-bench Verified (bash only)52.8%—
Aider Polyglot64.9%—
GSO3.8%—
LiveBench Coding74.5%—
CadEval54%—

Agentic & Tool Use Not comparable

Claude 3.7 Sonnet: 34.1 (#50), Gemma 3n E4b IT: —

Agentic & Tool Use benchmarks
BenchmarkClaude 3.7 SonnetGemma 3n E4b IT
TheAgentCompany30.9%—
Cybench20%—
DeepResearch Bench43.6%—
OSWorld35.8%—
METR Time Horizons60%—

Reasoning Gemma 3n E4b IT leads

Claude 3.7 Sonnet: 18.6 (#277), Gemma 3n E4b IT: 19.9 (#247)

Reasoning benchmarks
BenchmarkClaude 3.7 SonnetGemma 3n E4b IT
LMArena Hard Prompts13331284
ARC-AGI-20.9%—
SimpleBench46.4%—
Kagi LLM Benchmark—31.5%
ARC-AGI-128.6%—
EnigmaEval4.2%—
LiveBench Reasoning87.8%—
LiveBench Data Analysis74%—
Epoch Capabilities Index141.16—
ForecastBench61.8—
LiveBench76.1%—

Math Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 37.5 (#153), Gemma 3n E4b IT: 35.1 (#188)

Math benchmarks
BenchmarkClaude 3.7 SonnetGemma 3n E4b IT
LMArena Math13371251
OTIS Mock AIME 2024-202557.8%—
Omni-MATH33%—
LiveBench Math79%—
MATH Level 591.2%—
FrontierMath (Feb 2025 set)4.1%—

Knowledge Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 39.8 (#130), Gemma 3n E4b IT: 34.2 (#198)

Knowledge benchmarks
BenchmarkClaude 3.7 SonnetGemma 3n E4b IT
LMArena Expert13211246
GPQA Diamond79.7%—
Humanity's Last Exam8%—
MMLU-Pro78.4%—
Confabulations14.7%—
GPQA (HELM)60.8%—

Multimodal Not comparable

Claude 3.7 Sonnet: 33.7 (#95), Gemma 3n E4b IT: —

Multimodal benchmarks
BenchmarkClaude 3.7 SonnetGemma 3n E4b IT
LMArena Vision1169—
GeoBench68%—
VPCT39%—
SpatialViz-Bench33.9%—

Multilingual Too close to call

Claude 3.7 Sonnet: 44.1 (#179), Gemma 3n E4b IT: 43.4 (#183)

Multilingual benchmarks
BenchmarkClaude 3.7 SonnetGemma 3n E4b IT
LMArena Non-English12961285
LMArena Chinese12991309
LMArena French13031330
LMArena German13011311
LMArena Japanese12671272
LMArena Korean12491259
LMArena Russian13111288
LMArena Spanish12981305

Instruction Following Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 72.9 (#125), Gemma 3n E4b IT: 66.1 (#210)

Instruction Following benchmarks
BenchmarkClaude 3.7 SonnetGemma 3n E4b IT
LMArena Instruction Following13521255
LiveBench Instruction Following81.3%—
IFEval83.4%—

Long Context Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 50.3 (#10), Gemma 3n E4b IT: 38.7 (#191)

Long Context benchmarks
BenchmarkClaude 3.7 SonnetGemma 3n E4b IT
LMArena Longer Query13731276
Fiction.LiveBench83.3%—

Writing & Preference Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 54.4 (#150), Gemma 3n E4b IT: 50.1 (#186)

Writing & Preference benchmarks
BenchmarkClaude 3.7 SonnetGemma 3n E4b IT
LMArena Text13141306
LMArena Creative Writing13321287
LMArena Multi-Turn13391276
Short-Story Creative Writing81.1%—
EQ-Bench Creative Writing1412—
WildBench81.4%—
LiveBench Language59.9%—

Frequently asked questions

Is Claude 3.7 Sonnet better than Gemma 3n E4b IT?

Claude 3.7 Sonnet is the stronger model overall, scoring 39.5 to 37.3 on the Noometry Index.

Is Claude 3.7 Sonnet or Gemma 3n E4b IT better for coding?

Claude 3.7 Sonnet scores higher on coding benchmarks: 40.6 versus 37.0 in the Noometry coding category.

How many benchmarks do Claude 3.7 Sonnet and Gemma 3n E4b IT share?

17 benchmarks have published results for both models. Claude 3.7 Sonnet has 58 scored results on Noometry and Gemma 3n E4b IT has 18.

Related comparisons

Go deeper