Model comparison

Phi 3 Mini 4k Instruct June 2024 vs Qwen2.5 72B Instruct

Phi 3 Mini 4k Instruct June 2024 and Qwen2.5 72B Instruct score almost the same on the Noometry Index (31.3 vs 31.9), so choose on price, context window or the category you care about most.

Last verified . 15 shared benchmarks.

Summary

  • They share 15 benchmarks with published results for both. Phi 3 Mini 4k Instruct June 2024 scores higher in 2 categories and Qwen2.5 72B Instruct in 6 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Qwen2.5 72B Instruct leads 46.7 to 29.6.

Side by side

Phi 3 Mini 4k Instruct June 2024 and Qwen2.5 72B Instruct specifications
Phi 3 Mini 4k Instruct June 2024Qwen2.5 72B Instruct
ProviderMicrosoftAlibaba (Qwen)
Noometry Index31.331.9
Released—2024-09
WeightsOpenOpen
Context window—131K
Max output—8K
Input $ / M tokens—$1.40
Output $ / M tokens—$5.60
Results tracked1543

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Qwen2.5 72B Instruct leads

Phi 3 Mini 4k Instruct June 2024: 31.8 (#279), Qwen2.5 72B Instruct: 33.2 (#260)

Coding benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen2.5 72B Instruct
LMArena Coding10931292
WeirdML—16%
BigCodeBench Instruct—45.8%
BigCodeBench Complete—55.9%

Agentic & Tool Use Not comparable

Phi 3 Mini 4k Instruct June 2024: —, Qwen2.5 72B Instruct: 22.1 (#133)

Agentic & Tool Use benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen2.5 72B Instruct
TheAgentCompany—5.7%
BALROG—16.2%
METR Time Horizons—35.8%

Reasoning Qwen2.5 72B Instruct leads

Phi 3 Mini 4k Instruct June 2024: 20.8 (#231), Qwen2.5 72B Instruct: 22.3 (#199)

Reasoning benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen2.5 72B Instruct
LMArena Hard Prompts10871271
DTBench—62.9%
LMCA—13.4%
BIG-Bench Hard—79.8%
Epoch Capabilities Index—129
ForecastBench—57.5
HellaSwag—84.8%
PIQA—82.6%
WinoGrande—82.3%

Math Phi 3 Mini 4k Instruct June 2024 leads

Phi 3 Mini 4k Instruct June 2024: 33.0 (#208), Qwen2.5 72B Instruct: 19.3 (#287)

Math benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen2.5 72B Instruct
LMArena Math11521283
OTIS Mock AIME 2024-2025—8.1%
Omni-MATH—33%
MATH Level 5—63.2%

Knowledge Phi 3 Mini 4k Instruct June 2024 leads

Phi 3 Mini 4k Instruct June 2024: 28.6 (#244), Qwen2.5 72B Instruct: 27.0 (#253)

Knowledge benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen2.5 72B Instruct
LMArena Expert10511245
GPQA Diamond—49.1%
MMLU-Pro—63.1%
Confabulations—19.1%
GPQA (HELM)—42.6%
ARC (AI2) Challenge—94.5%
MMLU—85.3%
TriviaQA—71.9%

Multilingual Qwen2.5 72B Instruct leads

Phi 3 Mini 4k Instruct June 2024: 25.9 (#282), Qwen2.5 72B Instruct: 41.0 (#213)

Multilingual benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen2.5 72B Instruct
LMArena Non-English10131252
LMArena Chinese10331272
LMArena German10311234
LMArena Japanese9541180
LMArena Korean8801188
LMArena Russian10191264
LMArena French—1280
LMArena Spanish—1256

Instruction Following Qwen2.5 72B Instruct leads

Phi 3 Mini 4k Instruct June 2024: 54.1 (#282), Qwen2.5 72B Instruct: 65.5 (#221)

Instruction Following benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen2.5 72B Instruct
LMArena Instruction Following10581254
IFEval—80.6%

Long Context Qwen2.5 72B Instruct leads

Phi 3 Mini 4k Instruct June 2024: 31.7 (#277), Qwen2.5 72B Instruct: 38.9 (#188)

Long Context benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen2.5 72B Instruct
LMArena Longer Query10421282

Writing & Preference Qwen2.5 72B Instruct leads

Phi 3 Mini 4k Instruct June 2024: 29.6 (#294), Qwen2.5 72B Instruct: 46.7 (#215)

Writing & Preference benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen2.5 72B Instruct
LMArena Text10801269
LMArena Creative Writing10451221
LMArena Multi-Turn10491272
WildBench—80.2%

Frequently asked questions

Is Phi 3 Mini 4k Instruct June 2024 better than Qwen2.5 72B Instruct?

Phi 3 Mini 4k Instruct June 2024 and Qwen2.5 72B Instruct score almost the same on the Noometry Index (31.3 vs 31.9), so choose on price, context window or the category you care about most.

Is Phi 3 Mini 4k Instruct June 2024 or Qwen2.5 72B Instruct better for coding?

Qwen2.5 72B Instruct scores higher on coding benchmarks: 33.2 versus 31.8 in the Noometry coding category.

How many benchmarks do Phi 3 Mini 4k Instruct June 2024 and Qwen2.5 72B Instruct share?

15 benchmarks have published results for both models. Phi 3 Mini 4k Instruct June 2024 has 15 scored results on Noometry and Qwen2.5 72B Instruct has 43.

Related comparisons

Go deeper