Model comparison

Phi 3 Medium 4k Instruct vs Qwen1.5 4b Chat

Phi 3 Medium 4k Instruct is the stronger model overall, scoring 33.0 to 28.8 on the Noometry Index.

Last verified . 13 shared benchmarks.

Phi 3 Medium 4k Instruct Microsoft

33.0

Rank #250 Confirmed

Qwen1.5 4b Chat Alibaba (Qwen)

28.8

Rank #322 Confirmed

Summary

  • They share 13 benchmarks with published results for both. Phi 3 Medium 4k Instruct scores higher in 8 categories and Qwen1.5 4b Chat in 0 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Phi 3 Medium 4k Instruct leads 34.1 to 23.8.

Side by side

Phi 3 Medium 4k Instruct and Qwen1.5 4b Chat specifications
Phi 3 Medium 4k InstructQwen1.5 4b Chat
ProviderMicrosoftAlibaba (Qwen)
Noometry Index33.028.8
Released——
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1713

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Phi 3 Medium 4k Instruct leads

Phi 3 Medium 4k Instruct: 32.9 (#268), Qwen1.5 4b Chat: 29.1 (#308)

Coding benchmarks
BenchmarkPhi 3 Medium 4k InstructQwen1.5 4b Chat
LMArena Coding1130999

Reasoning Phi 3 Medium 4k Instruct leads

Phi 3 Medium 4k Instruct: 21.7 (#214), Qwen1.5 4b Chat: 18.5 (#279)

Reasoning benchmarks
BenchmarkPhi 3 Medium 4k InstructQwen1.5 4b Chat
LMArena Hard Prompts1127976

Math Phi 3 Medium 4k Instruct leads

Phi 3 Medium 4k Instruct: 33.4 (#202), Qwen1.5 4b Chat: 30.4 (#234)

Math benchmarks
BenchmarkPhi 3 Medium 4k InstructQwen1.5 4b Chat
LMArena Math11731026

Knowledge Phi 3 Medium 4k Instruct leads

Phi 3 Medium 4k Instruct: 30.2 (#229), Qwen1.5 4b Chat: 26.7 (#255)

Knowledge benchmarks
BenchmarkPhi 3 Medium 4k InstructQwen1.5 4b Chat
LMArena Expert1108980

Multilingual Phi 3 Medium 4k Instruct leads

Phi 3 Medium 4k Instruct: 30.6 (#263), Qwen1.5 4b Chat: 24.1 (#290)

Multilingual benchmarks
BenchmarkPhi 3 Medium 4k InstructQwen1.5 4b Chat
LMArena Non-English1094979
LMArena Chinese11081024
LMArena German1101902
LMArena Russian1145952
LMArena French1110—
LMArena Japanese1042—
LMArena Korean954—
LMArena Spanish1095—

Instruction Following Phi 3 Medium 4k Instruct leads

Phi 3 Medium 4k Instruct: 57.6 (#268), Qwen1.5 4b Chat: 49.0 (#300)

Instruction Following benchmarks
BenchmarkPhi 3 Medium 4k InstructQwen1.5 4b Chat
LMArena Instruction Following1113978

Long Context Phi 3 Medium 4k Instruct leads

Phi 3 Medium 4k Instruct: 34.0 (#255), Qwen1.5 4b Chat: 30.1 (#290)

Long Context benchmarks
BenchmarkPhi 3 Medium 4k InstructQwen1.5 4b Chat
LMArena Longer Query1120988

Writing & Preference Phi 3 Medium 4k Instruct leads

Phi 3 Medium 4k Instruct: 34.1 (#272), Qwen1.5 4b Chat: 23.8 (#309)

Writing & Preference benchmarks
BenchmarkPhi 3 Medium 4k InstructQwen1.5 4b Chat
LMArena Text1138997
LMArena Creative Writing1107969
LMArena Multi-Turn1088977

Frequently asked questions

Is Phi 3 Medium 4k Instruct better than Qwen1.5 4b Chat?

Phi 3 Medium 4k Instruct is the stronger model overall, scoring 33.0 to 28.8 on the Noometry Index.

Is Phi 3 Medium 4k Instruct or Qwen1.5 4b Chat better for coding?

Phi 3 Medium 4k Instruct scores higher on coding benchmarks: 32.9 versus 29.1 in the Noometry coding category.

How many benchmarks do Phi 3 Medium 4k Instruct and Qwen1.5 4b Chat share?

13 benchmarks have published results for both models. Phi 3 Medium 4k Instruct has 17 scored results on Noometry and Qwen1.5 4b Chat has 13.

Related comparisons

Go deeper