Model comparison

Gemma 2 27B vs Phi 3 Mini 128k Instruct

Gemma 2 27B and Phi 3 Mini 128k Instruct score almost the same on the Noometry Index (29.4 vs 29.7), so choose on price, context window or the category you care about most.

Last verified . 19 shared benchmarks.

Gemma 2 27B Google

29.4

Rank #312 Confirmed

Phi 3 Mini 128k Instruct Microsoft

29.7

Rank #305 Confirmed

Summary

  • They share 19 benchmarks with published results for both. Gemma 2 27B scores higher in 5 categories and Phi 3 Mini 128k Instruct in 3 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Phi 3 Mini 128k Instruct leads 31.6 to 10.7.
  • The biggest single-benchmark swing is BigCodeBench Instruct: 42.8% for Gemma 2 27B and 29.6% for Phi 3 Mini 128k Instruct.

Side by side

Gemma 2 27B and Phi 3 Mini 128k Instruct specifications
Gemma 2 27BPhi 3 Mini 128k Instruct
ProviderGoogleMicrosoft
Noometry Index29.429.7
Released2024-06-242024-04-23
WeightsOpenOpen
Context window8K—
Max output2K—
Input $ / M tokens$0.65—
Output $ / M tokens$0.65—
Results tracked3419

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemma 2 27B leads

Gemma 2 27B: 34.1 (#246), Phi 3 Mini 128k Instruct: 28.8 (#312)

Coding benchmarks
BenchmarkGemma 2 27BPhi 3 Mini 128k Instruct
BigCodeBench Instruct42.8%29.6%
LMArena Coding12111039
BigCodeBench Complete52.5%40.6%
LiveBench Coding36%—

Reasoning Phi 3 Mini 128k Instruct leads

Gemma 2 27B: 15.3 (#315), Phi 3 Mini 128k Instruct: 19.6 (#256)

Reasoning benchmarks
BenchmarkGemma 2 27BPhi 3 Mini 128k Instruct
LMArena Hard Prompts11981028
LiveBench Reasoning28.1%—
DTBench48%—
LiveBench Data Analysis47.9%—
LMCA7.1%—
Epoch Capabilities Index122.08—
LiveBench38.2%—

Math Phi 3 Mini 128k Instruct leads

Gemma 2 27B: 10.7 (#311), Phi 3 Mini 128k Instruct: 31.6 (#222)

Math benchmarks
BenchmarkGemma 2 27BPhi 3 Mini 128k Instruct
LMArena Math12121089
OTIS Mock AIME 2024-20251.4%—
LiveBench Math26.5%—
MATH Level 527.9%—

Knowledge Phi 3 Mini 128k Instruct leads

Gemma 2 27B: 19.0 (#280), Phi 3 Mini 128k Instruct: 26.8 (#254)

Knowledge benchmarks
BenchmarkGemma 2 27BPhi 3 Mini 128k Instruct
LMArena Expert1172984
GPQA Diamond36.5%—
Confabulations27.1%—
MMLU75.7%—

Multilingual Gemma 2 27B leads

Gemma 2 27B: 38.6 (#226), Phi 3 Mini 128k Instruct: 25.2 (#285)

Multilingual benchmarks
BenchmarkGemma 2 27BPhi 3 Mini 128k Instruct
LMArena Non-English12171000
LMArena Chinese12211016
LMArena French12471039
LMArena German12091006
LMArena Japanese1175899
LMArena Korean1174856
LMArena Russian12341004
LMArena Spanish12281059

Instruction Following Gemma 2 27B leads

Gemma 2 27B: 60.5 (#249), Phi 3 Mini 128k Instruct: 51.8 (#294)

Instruction Following benchmarks
BenchmarkGemma 2 27BPhi 3 Mini 128k Instruct
LMArena Instruction Following12061023
LiveBench Instruction Following58.1%—

Long Context Gemma 2 27B leads

Gemma 2 27B: 37.3 (#218), Phi 3 Mini 128k Instruct: 30.4 (#289)

Long Context benchmarks
BenchmarkGemma 2 27BPhi 3 Mini 128k Instruct
LMArena Longer Query1231996

Writing & Preference Gemma 2 27B leads

Gemma 2 27B: 44.2 (#225), Phi 3 Mini 128k Instruct: 27.1 (#301)

Writing & Preference benchmarks
BenchmarkGemma 2 27BPhi 3 Mini 128k Instruct
LMArena Text12311050
LMArena Creative Writing12411024
LMArena Multi-Turn1224989
LiveBench Language32.6%—

Frequently asked questions

Is Gemma 2 27B better than Phi 3 Mini 128k Instruct?

Gemma 2 27B and Phi 3 Mini 128k Instruct score almost the same on the Noometry Index (29.4 vs 29.7), so choose on price, context window or the category you care about most.

Is Gemma 2 27B or Phi 3 Mini 128k Instruct better for coding?

Gemma 2 27B scores higher on coding benchmarks: 34.1 versus 28.8 in the Noometry coding category.

How many benchmarks do Gemma 2 27B and Phi 3 Mini 128k Instruct share?

19 benchmarks have published results for both models. Gemma 2 27B has 34 scored results on Noometry and Phi 3 Mini 128k Instruct has 19.

Related comparisons

Go deeper