Model comparison

Gemma 3n E4b IT vs Grok 4.1 Fast

Grok 4.1 Fast is the stronger model overall, scoring 41.4 to 37.3 on the Noometry Index.

Last verified . 17 shared benchmarks.

Gemma 3n E4b IT Google

37.3

Rank #206 Confirmed

Grok 4.1 Fast xAI

41.4

Rank #136 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Gemma 3n E4b IT scores higher in 3 categories and Grok 4.1 Fast in 5 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Grok 4.1 Fast leads 43.4 to 19.9.
  • Gemma 3n E4b IT has downloadable open weights; the other is API-only.

Side by side

Gemma 3n E4b IT and Grok 4.1 Fast specifications
Gemma 3n E4b ITGrok 4.1 Fast
ProviderGooglexAI
Noometry Index37.341.4
Released—2025-06-27
WeightsOpenProprietary
Context window—128K
Max output—30K
Input $ / M tokens—$0.20
Output $ / M tokens—$0.50
Results tracked1832

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemma 3n E4b IT leads

Gemma 3n E4b IT: 37.0 (#198), Grok 4.1 Fast: 34.1 (#245)

Coding benchmarks
BenchmarkGemma 3n E4b ITGrok 4.1 Fast
LMArena Coding12681411
LMArena WebDev—1242
ALE-Bench—394.93

Agentic & Tool Use Not comparable

Gemma 3n E4b IT: —, Grok 4.1 Fast: 36.3 (#39)

Agentic & Tool Use benchmarks
BenchmarkGemma 3n E4b ITGrok 4.1 Fast
Berkeley Function Calling Leaderboard—69.6%
τ²-bench Banking—13.1%
LMArena Search—1171
Vending-Bench 2—1,107

Reasoning Grok 4.1 Fast leads

Gemma 3n E4b IT: 19.9 (#247), Grok 4.1 Fast: 43.4 (#49)

Reasoning benchmarks
BenchmarkGemma 3n E4b ITGrok 4.1 Fast
LMArena Hard Prompts12841407
SimpleBench—56%
Kagi LLM Benchmark31.5%—
NYT Connections (extended)—87.4%
DTBench—87.7%
ForecastBench—61

Math Gemma 3n E4b IT leads

Gemma 3n E4b IT: 35.1 (#188), Grok 4.1 Fast: 31.9 (#221)

Math benchmarks
BenchmarkGemma 3n E4b ITGrok 4.1 Fast
LMArena Math12511408
MathArena Final-Answer Competitions—60.9%
ProofBench—4%

Knowledge Gemma 3n E4b IT leads

Gemma 3n E4b IT: 34.2 (#198), Grok 4.1 Fast: 33.1 (#207)

Knowledge benchmarks
BenchmarkGemma 3n E4b ITGrok 4.1 Fast
LMArena Expert12461399
Vectara Hallucination Rate—17.8%

Multimodal Not comparable

Gemma 3n E4b IT: —, Grok 4.1 Fast: 37.0 (#76)

Multimodal benchmarks
BenchmarkGemma 3n E4b ITGrok 4.1 Fast
LMArena Vision—1201

Multilingual Grok 4.1 Fast leads

Gemma 3n E4b IT: 43.4 (#183), Grok 4.1 Fast: 51.0 (#114)

Multilingual benchmarks
BenchmarkGemma 3n E4b ITGrok 4.1 Fast
LMArena Non-English12851391
LMArena Chinese13091441
LMArena French13301415
LMArena German13111404
LMArena Japanese12721349
LMArena Korean12591361
LMArena Russian12881387
LMArena Spanish13051413

Instruction Following Grok 4.1 Fast leads

Gemma 3n E4b IT: 66.1 (#210), Grok 4.1 Fast: 72.7 (#133)

Instruction Following benchmarks
BenchmarkGemma 3n E4b ITGrok 4.1 Fast
LMArena Instruction Following12551376

Long Context Grok 4.1 Fast leads

Gemma 3n E4b IT: 38.7 (#191), Grok 4.1 Fast: 42.4 (#126)

Long Context benchmarks
BenchmarkGemma 3n E4b ITGrok 4.1 Fast
LMArena Longer Query12761390

Writing & Preference Grok 4.1 Fast leads

Gemma 3n E4b IT: 50.1 (#186), Grok 4.1 Fast: 57.2 (#131)

Writing & Preference benchmarks
BenchmarkGemma 3n E4b ITGrok 4.1 Fast
LMArena Text13061408
LMArena Creative Writing12871394
LMArena Multi-Turn12761389
EQ-Bench Creative Writing—1327

Frequently asked questions

Is Gemma 3n E4b IT better than Grok 4.1 Fast?

Grok 4.1 Fast is the stronger model overall, scoring 41.4 to 37.3 on the Noometry Index.

Is Gemma 3n E4b IT or Grok 4.1 Fast better for coding?

Gemma 3n E4b IT scores higher on coding benchmarks: 37.0 versus 34.1 in the Noometry coding category.

How many benchmarks do Gemma 3n E4b IT and Grok 4.1 Fast share?

17 benchmarks have published results for both models. Gemma 3n E4b IT has 18 scored results on Noometry and Grok 4.1 Fast has 32.

Related comparisons

Go deeper