Model comparison

Llama 4 Maverick vs Phi 3 Mini 4k Instruct June 2024

Llama 4 Maverick and Phi 3 Mini 4k Instruct June 2024 score almost the same on the Noometry Index (30.9 vs 31.3), so choose on price, context window or the category you care about most.

Last verified . 15 shared benchmarks.

Llama 4 Maverick Meta

30.9

Rank #282 Confirmed

Summary

  • They share 15 benchmarks with published results for both. Llama 4 Maverick scores higher in 4 categories and Phi 3 Mini 4k Instruct June 2024 in 4 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in instruction following, where Llama 4 Maverick leads 71.7 to 54.1.

Side by side

Llama 4 Maverick and Phi 3 Mini 4k Instruct June 2024 specifications
Llama 4 MaverickPhi 3 Mini 4k Instruct June 2024
ProviderMetaMicrosoft
Noometry Index30.931.3
Released2025-04-05—
WeightsOpenOpen
Context window128K—
Max output4K—
Input $ / M tokens$0.19—
Output $ / M tokens$0.65—
Results tracked5415

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Phi 3 Mini 4k Instruct June 2024 leads

Llama 4 Maverick: 26.6 (#324), Phi 3 Mini 4k Instruct June 2024: 31.8 (#279)

Coding benchmarks
BenchmarkLlama 4 MaverickPhi 3 Mini 4k Instruct June 2024
LMArena Coding13021093
SWE-bench Verified (bash only)21%—
Aider Polyglot15.6%—
SciCode33.1%—
WeirdML24.5%—
BigCodeBench Instruct49.7%—
BigCodeBench Complete61.4%—
ALE-Bench172.97—

Agentic & Tool Use Not comparable

Llama 4 Maverick: 28.2 (#91), Phi 3 Mini 4k Instruct June 2024: —

Agentic & Tool Use benchmarks
BenchmarkLlama 4 MaverickPhi 3 Mini 4k Instruct June 2024
Berkeley Function Calling Leaderboard37.3%—

Reasoning Phi 3 Mini 4k Instruct June 2024 leads

Llama 4 Maverick: 10.1 (#342), Phi 3 Mini 4k Instruct June 2024: 20.8 (#231)

Reasoning benchmarks
BenchmarkLlama 4 MaverickPhi 3 Mini 4k Instruct June 2024
LMArena Hard Prompts12811087
ARC-AGI-20%—
SimpleBench27.7%—
Kagi LLM Benchmark55.9%—
NYT Connections (extended)8%—
ARC-AGI-14.4%—
CritPt0%—
EnigmaEval0.6%—
DTBench61.9%—
LMCA15.9%—
Epoch Capabilities Index132.2—
ForecastBench57.5—

Math Phi 3 Mini 4k Instruct June 2024 leads

Llama 4 Maverick: 26.0 (#262), Phi 3 Mini 4k Instruct June 2024: 33.0 (#208)

Math benchmarks
BenchmarkLlama 4 MaverickPhi 3 Mini 4k Instruct June 2024
LMArena Math12991152
OTIS Mock AIME 2024-202520.6%—
Omni-MATH42.2%—
MATH Level 573%—
FrontierMath (Feb 2025 set)0.7%—

Knowledge Llama 4 Maverick leads

Llama 4 Maverick: 33.4 (#204), Phi 3 Mini 4k Instruct June 2024: 28.6 (#244)

Knowledge benchmarks
BenchmarkLlama 4 MaverickPhi 3 Mini 4k Instruct June 2024
LMArena Expert12591051
GPQA Diamond67%—
Humanity's Last Exam5.7%—
MMLU-Pro81%—
Confabulations22.6%—
Vectara Hallucination Rate8.2%—
GPQA (HELM)65%—

Multimodal Not comparable

Llama 4 Maverick: 31.6 (#105), Phi 3 Mini 4k Instruct June 2024: —

Multimodal benchmarks
BenchmarkLlama 4 MaverickPhi 3 Mini 4k Instruct June 2024
LMArena Vision1142—
GeoBench52%—
SpatialViz-Bench31.8%—

Multilingual Llama 4 Maverick leads

Llama 4 Maverick: 42.2 (#195), Phi 3 Mini 4k Instruct June 2024: 25.9 (#282)

Multilingual benchmarks
BenchmarkLlama 4 MaverickPhi 3 Mini 4k Instruct June 2024
LMArena Non-English12691013
LMArena Chinese12771033
LMArena German12911031
LMArena Japanese1207954
LMArena Korean1203880
LMArena Russian12861019
LMArena French1259—
LMArena Spanish1293—

Instruction Following Llama 4 Maverick leads

Llama 4 Maverick: 71.7 (#146), Phi 3 Mini 4k Instruct June 2024: 54.1 (#282)

Instruction Following benchmarks
BenchmarkLlama 4 MaverickPhi 3 Mini 4k Instruct June 2024
LMArena Instruction Following12671058
IFEval90.8%—

Long Context Too close to call

Llama 4 Maverick: 31.4 (#279), Phi 3 Mini 4k Instruct June 2024: 31.7 (#277)

Long Context benchmarks
BenchmarkLlama 4 MaverickPhi 3 Mini 4k Instruct June 2024
LMArena Longer Query12801042
Fiction.LiveBench46.2%—

Writing & Preference Llama 4 Maverick leads

Llama 4 Maverick: 38.8 (#252), Phi 3 Mini 4k Instruct June 2024: 29.6 (#294)

Writing & Preference benchmarks
BenchmarkLlama 4 MaverickPhi 3 Mini 4k Instruct June 2024
LMArena Text12871080
LMArena Creative Writing12671045
LMArena Multi-Turn12891049
Short-Story Creative Writing62%—
EQ-Bench Creative Writing860—
WildBench80%—

Frequently asked questions

Is Llama 4 Maverick better than Phi 3 Mini 4k Instruct June 2024?

Llama 4 Maverick and Phi 3 Mini 4k Instruct June 2024 score almost the same on the Noometry Index (30.9 vs 31.3), so choose on price, context window or the category you care about most.

Is Llama 4 Maverick or Phi 3 Mini 4k Instruct June 2024 better for coding?

Phi 3 Mini 4k Instruct June 2024 scores higher on coding benchmarks: 31.8 versus 26.6 in the Noometry coding category.

How many benchmarks do Llama 4 Maverick and Phi 3 Mini 4k Instruct June 2024 share?

15 benchmarks have published results for both models. Llama 4 Maverick has 54 scored results on Noometry and Phi 3 Mini 4k Instruct June 2024 has 15.

Related comparisons

Go deeper