Model comparison

Gemma 3n E4b IT vs Llama 3-70B

Gemma 3n E4b IT is the stronger model overall, scoring 37.3 to 28.8 on the Noometry Index.

Last verified . 18 shared benchmarks.

Gemma 3n E4b IT Google

37.3

Rank #206 Confirmed

Llama 3-70B Meta

28.8

Rank #323 Confirmed

Summary

  • They share 18 benchmarks with published results for both. Gemma 3n E4b IT scores higher in 8 categories and Llama 3-70B in 0 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Gemma 3n E4b IT leads 35.1 to 12.8.

Side by side

Gemma 3n E4b IT and Llama 3-70B specifications
Gemma 3n E4b ITLlama 3-70B
ProviderGoogleMeta
Noometry Index37.328.8
Released—2024-04-18
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1831

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemma 3n E4b IT leads

Gemma 3n E4b IT: 37.0 (#198), Llama 3-70B: 35.8 (#218)

Coding benchmarks
BenchmarkGemma 3n E4b ITLlama 3-70B
LMArena Coding12681206
BigCodeBench Instruct—43.6%
BigCodeBench Complete—54.5%
HumanEval+—72%
MBPP+—69%

Agentic & Tool Use Not comparable

Gemma 3n E4b IT: —, Llama 3-70B: 21.1 (#139)

Agentic & Tool Use benchmarks
BenchmarkGemma 3n E4b ITLlama 3-70B
Cybench—5%

Reasoning Gemma 3n E4b IT leads

Gemma 3n E4b IT: 19.9 (#247), Llama 3-70B: 18.0 (#288)

Reasoning benchmarks
BenchmarkGemma 3n E4b ITLlama 3-70B
Kagi LLM Benchmark31.5%35.1%
LMArena Hard Prompts12841195
DTBench—54.2%
Epoch Capabilities Index—122.93
ForecastBench—57.1
WinoGrande—83.5%

Math Gemma 3n E4b IT leads

Gemma 3n E4b IT: 35.1 (#188), Llama 3-70B: 12.8 (#305)

Math benchmarks
BenchmarkGemma 3n E4b ITLlama 3-70B
LMArena Math12511218
OTIS Mock AIME 2024-2025—4.3%
MATH Level 5—22.6%

Knowledge Gemma 3n E4b IT leads

Gemma 3n E4b IT: 34.2 (#198), Llama 3-70B: 20.8 (#277)

Knowledge benchmarks
BenchmarkGemma 3n E4b ITLlama 3-70B
LMArena Expert12461149
GPQA Diamond—40.6%
MMLU—79.3%

Multilingual Gemma 3n E4b IT leads

Gemma 3n E4b IT: 43.4 (#183), Llama 3-70B: 33.6 (#251)

Multilingual benchmarks
BenchmarkGemma 3n E4b ITLlama 3-70B
LMArena Non-English12851142
LMArena Chinese13091114
LMArena French13301232
LMArena German13111169
LMArena Japanese12721017
LMArena Korean12591017
LMArena Russian12881159
LMArena Spanish13051241

Instruction Following Gemma 3n E4b IT leads

Gemma 3n E4b IT: 66.1 (#210), Llama 3-70B: 62.5 (#238)

Instruction Following benchmarks
BenchmarkGemma 3n E4b ITLlama 3-70B
LMArena Instruction Following12551194

Long Context Gemma 3n E4b IT leads

Gemma 3n E4b IT: 38.7 (#191), Llama 3-70B: 35.6 (#240)

Long Context benchmarks
BenchmarkGemma 3n E4b ITLlama 3-70B
LMArena Longer Query12761174

Writing & Preference Gemma 3n E4b IT leads

Gemma 3n E4b IT: 50.1 (#186), Llama 3-70B: 42.8 (#231)

Writing & Preference benchmarks
BenchmarkGemma 3n E4b ITLlama 3-70B
LMArena Text13061221
LMArena Creative Writing12871210
LMArena Multi-Turn12761223

Frequently asked questions

Is Gemma 3n E4b IT better than Llama 3-70B?

Gemma 3n E4b IT is the stronger model overall, scoring 37.3 to 28.8 on the Noometry Index.

Is Gemma 3n E4b IT or Llama 3-70B better for coding?

Gemma 3n E4b IT scores higher on coding benchmarks: 37.0 versus 35.8 in the Noometry coding category.

How many benchmarks do Gemma 3n E4b IT and Llama 3-70B share?

18 benchmarks have published results for both models. Gemma 3n E4b IT has 18 scored results on Noometry and Llama 3-70B has 31.

Related comparisons

Go deeper