Model comparison

phi-3-medium 14B vs Qwen1.5 4b Chat

phi-3-medium 14B and Qwen1.5 4b Chat score almost the same on the Noometry Index (29.7 vs 28.8), so choose on price, context window or the category you care about most.

Last verified . 0 shared benchmarks.

phi-3-medium 14B Microsoft

29.7

Rank #306 Reported

Qwen1.5 4b Chat Alibaba (Qwen)

28.8

Rank #322 Confirmed

Summary

  • The widest gap is in knowledge, where Qwen1.5 4b Chat leads 26.7 to 9.1.

Side by side

phi-3-medium 14B and Qwen1.5 4b Chat specifications
phi-3-medium 14BQwen1.5 4b Chat
ProviderMicrosoftAlibaba (Qwen)
Noometry Index29.728.8
Released2024-04-23—
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1313

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding phi-3-medium 14B leads

phi-3-medium 14B: 36.8 (#201), Qwen1.5 4b Chat: 29.1 (#308)

Coding benchmarks
Benchmarkphi-3-medium 14BQwen1.5 4b Chat
BigCodeBench Instruct37.6%—
LMArena Coding—999
BigCodeBench Complete48.7%—

Reasoning Not comparable

phi-3-medium 14B: —, Qwen1.5 4b Chat: 18.5 (#279)

Reasoning benchmarks
Benchmarkphi-3-medium 14BQwen1.5 4b Chat
LMArena Hard Prompts—976
Adversarial NLI55.8%—
BIG-Bench Hard81.4%—
Epoch Capabilities Index121.23—
HellaSwag82.4%—
WinoGrande81.5%—

Math Qwen1.5 4b Chat leads

phi-3-medium 14B: 27.3 (#250), Qwen1.5 4b Chat: 30.4 (#234)

Math benchmarks
Benchmarkphi-3-medium 14BQwen1.5 4b Chat
LMArena Math—1026
MATH Level 517.6%—

Knowledge Qwen1.5 4b Chat leads

phi-3-medium 14B: 9.1 (#306), Qwen1.5 4b Chat: 26.7 (#255)

Knowledge benchmarks
Benchmarkphi-3-medium 14BQwen1.5 4b Chat
GPQA Diamond27.6%—
LMArena Expert—980
ARC (AI2) Challenge91.6%—
MMLU78%—
OpenBookQA87.4%—
TriviaQA73.9%—

Multilingual Not comparable

phi-3-medium 14B: —, Qwen1.5 4b Chat: 24.1 (#290)

Multilingual benchmarks
Benchmarkphi-3-medium 14BQwen1.5 4b Chat
LMArena Non-English—979
LMArena Chinese—1024
LMArena German—902
LMArena Russian—952

Instruction Following Not comparable

phi-3-medium 14B: —, Qwen1.5 4b Chat: 49.0 (#300)

Instruction Following benchmarks
Benchmarkphi-3-medium 14BQwen1.5 4b Chat
LMArena Instruction Following—978

Long Context Not comparable

phi-3-medium 14B: —, Qwen1.5 4b Chat: 30.1 (#290)

Long Context benchmarks
Benchmarkphi-3-medium 14BQwen1.5 4b Chat
LMArena Longer Query—988

Writing & Preference Not comparable

phi-3-medium 14B: —, Qwen1.5 4b Chat: 23.8 (#309)

Writing & Preference benchmarks
Benchmarkphi-3-medium 14BQwen1.5 4b Chat
LMArena Text—997
LMArena Creative Writing—969
LMArena Multi-Turn—977

Frequently asked questions

Is phi-3-medium 14B better than Qwen1.5 4b Chat?

phi-3-medium 14B and Qwen1.5 4b Chat score almost the same on the Noometry Index (29.7 vs 28.8), so choose on price, context window or the category you care about most.

Is phi-3-medium 14B or Qwen1.5 4b Chat better for coding?

phi-3-medium 14B scores higher on coding benchmarks: 36.8 versus 29.1 in the Noometry coding category.

How many benchmarks do phi-3-medium 14B and Qwen1.5 4b Chat share?

0 benchmarks have published results for both models. phi-3-medium 14B has 13 scored results on Noometry and Qwen1.5 4b Chat has 13.

Related comparisons

Go deeper