Model comparison

Phi-3.5-mini vs phi-3-medium 14B

phi-3-medium 14B has enough public results to be ranked (#306); Phi-3.5-mini does not yet, so treat this comparison as directional.

Last verified . 2 shared benchmarks.

Phi-3.5-mini Microsoft

36.9

Unranked Sparse

phi-3-medium 14B Microsoft

29.7

Rank #306 Reported

Summary

  • They share 2 benchmarks with published results for both. Phi-3.5-mini scores higher in 0 categories and phi-3-medium 14B in 1 category; one gap is clear of the uncertainty.
  • The biggest single-benchmark swing is BigCodeBench Complete: 38.5% for Phi-3.5-mini and 48.7% for phi-3-medium 14B.

Side by side

Phi-3.5-mini and phi-3-medium 14B specifications
Phi-3.5-miniphi-3-medium 14B
ProviderMicrosoftMicrosoft
Noometry Index36.929.7
Released2024-08-162024-04-23
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked513

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding phi-3-medium 14B leads

Phi-3.5-mini: 34.6 (#232), phi-3-medium 14B: 36.8 (#201)

Coding benchmarks
BenchmarkPhi-3.5-miniphi-3-medium 14B
BigCodeBench Instruct32.8%37.6%
BigCodeBench Complete38.5%48.7%

Reasoning Not comparable

Phi-3.5-mini: —, phi-3-medium 14B: —

Reasoning benchmarks
BenchmarkPhi-3.5-miniphi-3-medium 14B
Adversarial NLI—55.8%
BIG-Bench Hard—81.4%
Epoch Capabilities Index—121.23
HellaSwag—82.4%
PIQA81%—
WinoGrande—81.5%

Math Not comparable

Phi-3.5-mini: —, phi-3-medium 14B: 27.3 (#250)

Math benchmarks
BenchmarkPhi-3.5-miniphi-3-medium 14B
MATH Level 5—17.6%
GSM8K86.2%—

Knowledge Not comparable

Phi-3.5-mini: —, phi-3-medium 14B: 9.1 (#306)

Knowledge benchmarks
BenchmarkPhi-3.5-miniphi-3-medium 14B
GPQA Diamond—27.6%
ARC (AI2) Challenge—91.6%
BoolQ78%—
MMLU—78%
OpenBookQA—87.4%
TriviaQA—73.9%

Frequently asked questions

Is Phi-3.5-mini better than phi-3-medium 14B?

phi-3-medium 14B has enough public results to be ranked (#306); Phi-3.5-mini does not yet, so treat this comparison as directional.

Is Phi-3.5-mini or phi-3-medium 14B better for coding?

phi-3-medium 14B scores higher on coding benchmarks: 36.8 versus 34.6 in the Noometry coding category.

How many benchmarks do Phi-3.5-mini and phi-3-medium 14B share?

2 benchmarks have published results for both models. Phi-3.5-mini has 5 scored results on Noometry and phi-3-medium 14B has 13.

Related comparisons

Go deeper