Model comparison

Phi 3 Mini 4k Instruct June 2024 vs Qwen1.5 4b Chat

Phi 3 Mini 4k Instruct June 2024 is the stronger model overall, scoring 31.3 to 28.8 on the Noometry Index.

Last verified . 13 shared benchmarks.

Qwen1.5 4b Chat Alibaba (Qwen)

28.8

Rank #322 Confirmed

Summary

  • They share 13 benchmarks with published results for both. Phi 3 Mini 4k Instruct June 2024 scores higher in 8 categories and Qwen1.5 4b Chat in 0 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Phi 3 Mini 4k Instruct June 2024 leads 29.6 to 23.8.

Side by side

Phi 3 Mini 4k Instruct June 2024 and Qwen1.5 4b Chat specifications
Phi 3 Mini 4k Instruct June 2024Qwen1.5 4b Chat
ProviderMicrosoftAlibaba (Qwen)
Noometry Index31.328.8
Released——
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1513

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Phi 3 Mini 4k Instruct June 2024 leads

Phi 3 Mini 4k Instruct June 2024: 31.8 (#279), Qwen1.5 4b Chat: 29.1 (#308)

Coding benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen1.5 4b Chat
LMArena Coding1093999

Reasoning Phi 3 Mini 4k Instruct June 2024 leads

Phi 3 Mini 4k Instruct June 2024: 20.8 (#231), Qwen1.5 4b Chat: 18.5 (#279)

Reasoning benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen1.5 4b Chat
LMArena Hard Prompts1087976

Math Phi 3 Mini 4k Instruct June 2024 leads

Phi 3 Mini 4k Instruct June 2024: 33.0 (#208), Qwen1.5 4b Chat: 30.4 (#234)

Math benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen1.5 4b Chat
LMArena Math11521026

Knowledge Phi 3 Mini 4k Instruct June 2024 leads

Phi 3 Mini 4k Instruct June 2024: 28.6 (#244), Qwen1.5 4b Chat: 26.7 (#255)

Knowledge benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen1.5 4b Chat
LMArena Expert1051980

Multilingual Phi 3 Mini 4k Instruct June 2024 leads

Phi 3 Mini 4k Instruct June 2024: 25.9 (#282), Qwen1.5 4b Chat: 24.1 (#290)

Multilingual benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen1.5 4b Chat
LMArena Non-English1013979
LMArena Chinese10331024
LMArena German1031902
LMArena Russian1019952
LMArena Japanese954—
LMArena Korean880—

Instruction Following Phi 3 Mini 4k Instruct June 2024 leads

Phi 3 Mini 4k Instruct June 2024: 54.1 (#282), Qwen1.5 4b Chat: 49.0 (#300)

Instruction Following benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen1.5 4b Chat
LMArena Instruction Following1058978

Long Context Phi 3 Mini 4k Instruct June 2024 leads

Phi 3 Mini 4k Instruct June 2024: 31.7 (#277), Qwen1.5 4b Chat: 30.1 (#290)

Long Context benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen1.5 4b Chat
LMArena Longer Query1042988

Writing & Preference Phi 3 Mini 4k Instruct June 2024 leads

Phi 3 Mini 4k Instruct June 2024: 29.6 (#294), Qwen1.5 4b Chat: 23.8 (#309)

Writing & Preference benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen1.5 4b Chat
LMArena Text1080997
LMArena Creative Writing1045969
LMArena Multi-Turn1049977

Frequently asked questions

Is Phi 3 Mini 4k Instruct June 2024 better than Qwen1.5 4b Chat?

Phi 3 Mini 4k Instruct June 2024 is the stronger model overall, scoring 31.3 to 28.8 on the Noometry Index.

Is Phi 3 Mini 4k Instruct June 2024 or Qwen1.5 4b Chat better for coding?

Phi 3 Mini 4k Instruct June 2024 scores higher on coding benchmarks: 31.8 versus 29.1 in the Noometry coding category.

How many benchmarks do Phi 3 Mini 4k Instruct June 2024 and Qwen1.5 4b Chat share?

13 benchmarks have published results for both models. Phi 3 Mini 4k Instruct June 2024 has 15 scored results on Noometry and Qwen1.5 4b Chat has 13.

Related comparisons

Go deeper