Model comparison

o3-mini vs Phi 3 Mini 4k Instruct

o3-mini is the stronger model overall, scoring 36.7 to 27.9 on the Noometry Index.

Last verified . 25 shared benchmarks.

o3-mini OpenAI

36.7

Rank #212 Confirmed

Phi 3 Mini 4k Instruct Microsoft

27.9

Rank #328 Confirmed

Summary

  • They share 25 benchmarks with published results for both. o3-mini scores higher in 8 categories and Phi 3 Mini 4k Instruct in 0 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in instruction following, where o3-mini leads 75.1 to 47.7.
  • The biggest single-benchmark swing is LiveBench Coding: 82.7% for o3-mini and 15.5% for Phi 3 Mini 4k Instruct.
  • Phi 3 Mini 4k Instruct has downloadable open weights; the other is API-only.

Side by side

o3-mini and Phi 3 Mini 4k Instruct specifications
o3-miniPhi 3 Mini 4k Instruct
ProviderOpenAIMicrosoft
Noometry Index36.727.9
Released2024-12-202024-04-23
WeightsProprietaryOpen
Context window200K—
Max output100K—
Input $ / M tokens$1.10—
Output $ / M tokens$4.40—
Results tracked5135

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding o3-mini leads

o3-mini: 40.8 (#132), Phi 3 Mini 4k Instruct: 26.6 (#323)

Coding benchmarks
Benchmarko3-miniPhi 3 Mini 4k Instruct
LiveBench Coding82.7%15.5%
LMArena Coding13781093
Aider Polyglot60.4%—
SciCode39.8%—
GSO1.3%—
WeirdML43.7%—
CadEval54%—
HumanEval+—59.1%
MBPP+—54.2%

Agentic & Tool Use Not comparable

o3-mini: 29.6 (#84), Phi 3 Mini 4k Instruct: —

Agentic & Tool Use benchmarks
Benchmarko3-miniPhi 3 Mini 4k Instruct
Cybench22.5%—

Reasoning o3-mini leads

o3-mini: 16.3 (#305), Phi 3 Mini 4k Instruct: 14.1 (#328)

Reasoning benchmarks
Benchmarko3-miniPhi 3 Mini 4k Instruct
Chess Puzzles17%0%
LiveBench Reasoning89.6%26.8%
LMArena Hard Prompts13661072
LiveBench Data Analysis70.6%34.7%
LiveBench75.9%22.4%
ARC-AGI-23%—
SimpleBench22.8%—
ARC-AGI-134.5%—
CritPt0.3%—
Mystery Game Puzzles7%—
DTBench68.8%—
LMCA19%—
Adversarial NLI—52.8%
BIG-Bench Hard—71.7%
Epoch Capabilities Index140.34—
ForecastBench59.6—
HellaSwag—76.7%
WinoGrande—70.8%

Math o3-mini leads

o3-mini: 28.1 (#244), Phi 3 Mini 4k Instruct: 26.6 (#257)

Math benchmarks
Benchmarko3-miniPhi 3 Mini 4k Instruct
LiveBench Math77.3%15.7%
LMArena Math13961111
FrontierMath (Tiers 1-3)18.6%—
FrontierMath Tier 40%—
OTIS Mock AIME 2024-202576.9%—
MATH Level 596.5%—
FrontierMath (Feb 2025 set)12.4%—
FrontierMath Tier 4 (v1)4.2%—

Knowledge o3-mini leads

o3-mini: 38.3 (#146), Phi 3 Mini 4k Instruct: 28.5 (#246)

Knowledge benchmarks
Benchmarko3-miniPhi 3 Mini 4k Instruct
LMArena Expert13641045
GPQA Diamond77%—
SimpleQA Verified15.3%—
Confabulations17.9%—
ARC (AI2) Challenge—84.9%
MMLU—68.8%
OpenBookQA—88%
TriviaQA—64%

Multilingual o3-mini leads

o3-mini: 45.7 (#164), Phi 3 Mini 4k Instruct: 26.3 (#280)

Multilingual benchmarks
Benchmarko3-miniPhi 3 Mini 4k Instruct
LMArena Non-English13191021
LMArena Chinese13791021
LMArena French13341076
LMArena German13031044
LMArena Japanese1286935
LMArena Korean1314905
LMArena Russian13041022
LMArena Spanish13211085

Instruction Following o3-mini leads

o3-mini: 75.1 (#72), Phi 3 Mini 4k Instruct: 47.7 (#303)

Instruction Following benchmarks
Benchmarko3-miniPhi 3 Mini 4k Instruct
LiveBench Instruction Following84.4%39.1%
LMArena Instruction Following13371053

Long Context o3-mini leads

o3-mini: 33.8 (#256), Phi 3 Mini 4k Instruct: 31.7 (#276)

Long Context benchmarks
Benchmarko3-miniPhi 3 Mini 4k Instruct
LMArena Longer Query13431044
Fiction.LiveBench50%—

Writing & Preference o3-mini leads

o3-mini: 50.3 (#182), Phi 3 Mini 4k Instruct: 27.6 (#300)

Writing & Preference benchmarks
Benchmarko3-miniPhi 3 Mini 4k Instruct
LMArena Text13371073
LMArena Creative Writing12861037
LMArena Multi-Turn13201018
LiveBench Language50.7%9.2%
Short-Story Creative Writing61.7%—

Frequently asked questions

Is o3-mini better than Phi 3 Mini 4k Instruct?

o3-mini is the stronger model overall, scoring 36.7 to 27.9 on the Noometry Index.

Is o3-mini or Phi 3 Mini 4k Instruct better for coding?

o3-mini scores higher on coding benchmarks: 40.8 versus 26.6 in the Noometry coding category.

How many benchmarks do o3-mini and Phi 3 Mini 4k Instruct share?

25 benchmarks have published results for both models. o3-mini has 51 scored results on Noometry and Phi 3 Mini 4k Instruct has 35.

Related comparisons

Go deeper