Model comparison

GPT-4 vs Phi 3 Mini 4k Instruct

GPT-4 is the stronger model overall, scoring 29.1 to 27.9 on the Noometry Index.

Last verified . 24 shared benchmarks.

GPT-4 OpenAI

29.1

Rank #316 Confirmed

Phi 3 Mini 4k Instruct Microsoft

27.9

Rank #328 Confirmed

Summary

  • They share 24 benchmarks with published results for both. GPT-4 scores higher in 6 categories and Phi 3 Mini 4k Instruct in 2 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in instruction following, where GPT-4 leads 65.3 to 47.7.
  • Phi 3 Mini 4k Instruct has downloadable open weights; the other is API-only.

Side by side

GPT-4 and Phi 3 Mini 4k Instruct specifications
GPT-4Phi 3 Mini 4k Instruct
ProviderOpenAIMicrosoft
Noometry Index29.127.9
Released2023-03-142024-04-23
WeightsProprietaryOpen
Context window8K—
Max output8K—
Input $ / M tokens$30—
Output $ / M tokens$60—
Results tracked3835

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding GPT-4 leads

GPT-4: 31.6 (#283), Phi 3 Mini 4k Instruct: 26.6 (#323)

Coding benchmarks
BenchmarkGPT-4Phi 3 Mini 4k Instruct
LMArena Coding12541093
HumanEval+79.3%59.1%
WeirdML12.4%—
BigCodeBench Instruct46%—
LiveBench Coding—15.5%
BigCodeBench Complete57.2%—
MBPP+—54.2%

Agentic & Tool Use Not comparable

GPT-4: —, Phi 3 Mini 4k Instruct: —

Agentic & Tool Use benchmarks
BenchmarkGPT-4Phi 3 Mini 4k Instruct
METR Time Horizons36.1%—

Reasoning GPT-4 leads

GPT-4: 17.8 (#289), Phi 3 Mini 4k Instruct: 14.1 (#328)

Reasoning benchmarks
BenchmarkGPT-4Phi 3 Mini 4k Instruct
Chess Puzzles4%0%
LMArena Hard Prompts12411072
BIG-Bench Hard75.1%71.7%
HellaSwag95.3%76.7%
WinoGrande87.5%70.8%
LiveBench Reasoning—26.8%
Mystery Game Puzzles12%—
DTBench62.7%—
LiveBench Data Analysis—34.7%
LMCA17.1%—
Adversarial NLI—52.8%
Epoch Capabilities Index125.89—
ForecastBench57.8—
LiveBench—22.4%

Math Phi 3 Mini 4k Instruct leads

GPT-4: 10.8 (#309), Phi 3 Mini 4k Instruct: 26.6 (#257)

Math benchmarks
BenchmarkGPT-4Phi 3 Mini 4k Instruct
LMArena Math12691111
OTIS Mock AIME 2024-20251.1%—
LiveBench Math—15.7%
MATH Level 523%—
GSM8K92%—

Knowledge Phi 3 Mini 4k Instruct leads

GPT-4: 18.4 (#282), Phi 3 Mini 4k Instruct: 28.5 (#246)

Knowledge benchmarks
BenchmarkGPT-4Phi 3 Mini 4k Instruct
LMArena Expert12111045
MMLU86.4%68.8%
TriviaQA84.8%64%
GPQA Diamond35.7%—
ARC (AI2) Challenge—84.9%
OpenBookQA—88%

Multilingual GPT-4 leads

GPT-4: 40.6 (#215), Phi 3 Mini 4k Instruct: 26.3 (#280)

Multilingual benchmarks
BenchmarkGPT-4Phi 3 Mini 4k Instruct
LMArena Non-English12461021
LMArena Chinese12421021
LMArena French12831076
LMArena German12511044
LMArena Japanese1209935
LMArena Korean1184905
LMArena Russian12511022
LMArena Spanish12611085

Instruction Following GPT-4 leads

GPT-4: 65.3 (#222), Phi 3 Mini 4k Instruct: 47.7 (#303)

Instruction Following benchmarks
BenchmarkGPT-4Phi 3 Mini 4k Instruct
LMArena Instruction Following12411053
LiveBench Instruction Following—39.1%

Long Context GPT-4 leads

GPT-4: 37.7 (#212), Phi 3 Mini 4k Instruct: 31.7 (#276)

Long Context benchmarks
BenchmarkGPT-4Phi 3 Mini 4k Instruct
LMArena Longer Query12441044

Writing & Preference GPT-4 leads

GPT-4: 34.9 (#268), Phi 3 Mini 4k Instruct: 27.6 (#300)

Writing & Preference benchmarks
BenchmarkGPT-4Phi 3 Mini 4k Instruct
LMArena Text12631073
LMArena Creative Writing12441037
LMArena Multi-Turn12571018
EQ-Bench Creative Writing752—
LiveBench Language—9.2%

Frequently asked questions

Is GPT-4 better than Phi 3 Mini 4k Instruct?

GPT-4 is the stronger model overall, scoring 29.1 to 27.9 on the Noometry Index.

Is GPT-4 or Phi 3 Mini 4k Instruct better for coding?

GPT-4 scores higher on coding benchmarks: 31.6 versus 26.6 in the Noometry coding category.

How many benchmarks do GPT-4 and Phi 3 Mini 4k Instruct share?

24 benchmarks have published results for both models. GPT-4 has 38 scored results on Noometry and Phi 3 Mini 4k Instruct has 35.

Related comparisons

Go deeper