Model comparison

Gemma 3n E4b IT vs Llama 13b

Gemma 3n E4b IT is the stronger model overall, scoring 37.3 to 24.4 on the Noometry Index.

Last verified . 8 shared benchmarks.

Gemma 3n E4b IT Google

37.3

Rank #206 Confirmed

Llama 13b Meta

24.4

Rank #348 Confirmed

Summary

  • They share 8 benchmarks with published results for both. Gemma 3n E4b IT scores higher in 6 categories and Llama 13b in 0 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Gemma 3n E4b IT leads 50.1 to 13.8.

Side by side

Gemma 3n E4b IT and Llama 13b specifications
Gemma 3n E4b ITLlama 13b
ProviderGoogleMeta
Noometry Index37.324.4
Released—2023-02-24
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1821

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemma 3n E4b IT leads

Gemma 3n E4b IT: 37.0 (#198), Llama 13b: 21.4 (#337)

Coding benchmarks
BenchmarkGemma 3n E4b ITLlama 13b
LMArena Coding1268683

Reasoning Gemma 3n E4b IT leads

Gemma 3n E4b IT: 19.9 (#247), Llama 13b: 14.0 (#329)

Reasoning benchmarks
BenchmarkGemma 3n E4b ITLlama 13b
LMArena Hard Prompts1284728
Kagi LLM Benchmark31.5%—
BIG-Bench Hard—37.9%
Epoch Capabilities Index—100.58
HellaSwag—79.2%
LAMBADA—75.2%
PIQA—80.1%
WinoGrande—73%

Math Gemma 3n E4b IT leads

Gemma 3n E4b IT: 35.1 (#188), Llama 13b: 26.7 (#256)

Math benchmarks
BenchmarkGemma 3n E4b ITLlama 13b
LMArena Math1251838
GSM8K—20.6%

Knowledge Not comparable

Gemma 3n E4b IT: 34.2 (#198), Llama 13b: —

Knowledge benchmarks
BenchmarkGemma 3n E4b ITLlama 13b
LMArena Expert1246—
ARC (AI2) Challenge—52.7%
BoolQ—78.7%
MMLU—47.7%
OpenBookQA—56.4%
TriviaQA—77.9%

Multimodal Not comparable

Gemma 3n E4b IT: —, Llama 13b: —

Multimodal benchmarks
BenchmarkGemma 3n E4b ITLlama 13b
ScienceQA—43.3%

Multilingual Gemma 3n E4b IT leads

Gemma 3n E4b IT: 43.4 (#183), Llama 13b: 16.6 (#297)

Multilingual benchmarks
BenchmarkGemma 3n E4b ITLlama 13b
LMArena Non-English1285819
LMArena Chinese1309—
LMArena French1330—
LMArena German1311—
LMArena Japanese1272—
LMArena Korean1259—
LMArena Russian1288—
LMArena Spanish1305—

Instruction Following Gemma 3n E4b IT leads

Gemma 3n E4b IT: 66.1 (#210), Llama 13b: 36.7 (#305)

Instruction Following benchmarks
BenchmarkGemma 3n E4b ITLlama 13b
LMArena Instruction Following1255781

Long Context Not comparable

Gemma 3n E4b IT: 38.7 (#191), Llama 13b: —

Long Context benchmarks
BenchmarkGemma 3n E4b ITLlama 13b
LMArena Longer Query1276—

Writing & Preference Gemma 3n E4b IT leads

Gemma 3n E4b IT: 50.1 (#186), Llama 13b: 13.8 (#312)

Writing & Preference benchmarks
BenchmarkGemma 3n E4b ITLlama 13b
LMArena Text1306834
LMArena Creative Writing1287794
LMArena Multi-Turn1276753

Frequently asked questions

Is Gemma 3n E4b IT better than Llama 13b?

Gemma 3n E4b IT is the stronger model overall, scoring 37.3 to 24.4 on the Noometry Index.

Is Gemma 3n E4b IT or Llama 13b better for coding?

Gemma 3n E4b IT scores higher on coding benchmarks: 37.0 versus 21.4 in the Noometry coding category.

How many benchmarks do Gemma 3n E4b IT and Llama 13b share?

8 benchmarks have published results for both models. Gemma 3n E4b IT has 18 scored results on Noometry and Llama 13b has 21.

Related comparisons

Go deeper