Model comparison

Gemma 1.1 7b IT vs Phi 3 Mini 4k Instruct

Gemma 1.1 7b IT is the stronger model overall, scoring 31.3 to 27.9 on the Noometry Index.

Last verified . 19 shared benchmarks.

Gemma 1.1 7b IT Google

31.3

Rank #277 Confirmed

Phi 3 Mini 4k Instruct Microsoft

27.9

Rank #328 Confirmed

Summary

  • They share 19 benchmarks with published results for both. Gemma 1.1 7b IT scores higher in 7 categories and Phi 3 Mini 4k Instruct in 1 category; 6 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Gemma 1.1 7b IT leads 20.5 to 14.1.

Side by side

Gemma 1.1 7b IT and Phi 3 Mini 4k Instruct specifications
Gemma 1.1 7b ITPhi 3 Mini 4k Instruct
ProviderGoogleMicrosoft
Noometry Index31.327.9
Released—2024-04-23
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1935

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemma 1.1 7b IT leads

Gemma 1.1 7b IT: 31.5 (#284), Phi 3 Mini 4k Instruct: 26.6 (#323)

Coding benchmarks
BenchmarkGemma 1.1 7b ITPhi 3 Mini 4k Instruct
LMArena Coding10841093
HumanEval+35.4%59.1%
MBPP+45%54.2%
LiveBench Coding—15.5%

Reasoning Gemma 1.1 7b IT leads

Gemma 1.1 7b IT: 20.5 (#238), Phi 3 Mini 4k Instruct: 14.1 (#328)

Reasoning benchmarks
BenchmarkGemma 1.1 7b ITPhi 3 Mini 4k Instruct
LMArena Hard Prompts10711072
Chess Puzzles—0%
LiveBench Reasoning—26.8%
LiveBench Data Analysis—34.7%
Adversarial NLI—52.8%
BIG-Bench Hard—71.7%
HellaSwag—76.7%
LiveBench—22.4%
WinoGrande—70.8%

Math Gemma 1.1 7b IT leads

Gemma 1.1 7b IT: 32.0 (#220), Phi 3 Mini 4k Instruct: 26.6 (#257)

Math benchmarks
BenchmarkGemma 1.1 7b ITPhi 3 Mini 4k Instruct
LMArena Math11071111
LiveBench Math—15.7%

Knowledge Too close to call

Gemma 1.1 7b IT: 28.3 (#247), Phi 3 Mini 4k Instruct: 28.5 (#246)

Knowledge benchmarks
BenchmarkGemma 1.1 7b ITPhi 3 Mini 4k Instruct
LMArena Expert10391045
ARC (AI2) Challenge—84.9%
MMLU—68.8%
OpenBookQA—88%
TriviaQA—64%

Multilingual Gemma 1.1 7b IT leads

Gemma 1.1 7b IT: 28.1 (#273), Phi 3 Mini 4k Instruct: 26.3 (#280)

Multilingual benchmarks
BenchmarkGemma 1.1 7b ITPhi 3 Mini 4k Instruct
LMArena Non-English10521021
LMArena Chinese10611021
LMArena French10651076
LMArena German10541044
LMArena Japanese971935
LMArena Korean988905
LMArena Russian10461022
LMArena Spanish10491085

Instruction Following Gemma 1.1 7b IT leads

Gemma 1.1 7b IT: 54.0 (#283), Phi 3 Mini 4k Instruct: 47.7 (#303)

Instruction Following benchmarks
BenchmarkGemma 1.1 7b ITPhi 3 Mini 4k Instruct
LMArena Instruction Following10571053
LiveBench Instruction Following—39.1%

Long Context Too close to call

Gemma 1.1 7b IT: 32.1 (#272), Phi 3 Mini 4k Instruct: 31.7 (#276)

Long Context benchmarks
BenchmarkGemma 1.1 7b ITPhi 3 Mini 4k Instruct
LMArena Longer Query10561044

Writing & Preference Gemma 1.1 7b IT leads

Gemma 1.1 7b IT: 30.4 (#288), Phi 3 Mini 4k Instruct: 27.6 (#300)

Writing & Preference benchmarks
BenchmarkGemma 1.1 7b ITPhi 3 Mini 4k Instruct
LMArena Text10941073
LMArena Creative Writing10601037
LMArena Multi-Turn10401018
LiveBench Language—9.2%

Frequently asked questions

Is Gemma 1.1 7b IT better than Phi 3 Mini 4k Instruct?

Gemma 1.1 7b IT is the stronger model overall, scoring 31.3 to 27.9 on the Noometry Index.

Is Gemma 1.1 7b IT or Phi 3 Mini 4k Instruct better for coding?

Gemma 1.1 7b IT scores higher on coding benchmarks: 31.5 versus 26.6 in the Noometry coding category.

How many benchmarks do Gemma 1.1 7b IT and Phi 3 Mini 4k Instruct share?

19 benchmarks have published results for both models. Gemma 1.1 7b IT has 19 scored results on Noometry and Phi 3 Mini 4k Instruct has 35.

Related comparisons

Go deeper