Model comparison

Phi 3 Mini 128k Instruct vs Wizardlm 13b

Wizardlm 13b is the stronger model overall, scoring 31.4 to 29.7 on the Noometry Index.

Last verified . 10 shared benchmarks.

Phi 3 Mini 128k Instruct Microsoft

29.7

Rank #305 Confirmed

Wizardlm 13b Microsoft

31.4

Rank #274 Confirmed

Summary

  • They share 10 benchmarks with published results for both. Phi 3 Mini 128k Instruct scores higher in 2 categories and Wizardlm 13b in 5 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Wizardlm 13b leads 30.5 to 27.1.

Side by side

Phi 3 Mini 128k Instruct and Wizardlm 13b specifications
Phi 3 Mini 128k InstructWizardlm 13b
ProviderMicrosoftMicrosoft
Noometry Index29.731.4
Released2024-04-23—
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1910

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Wizardlm 13b leads

Phi 3 Mini 128k Instruct: 28.8 (#312), Wizardlm 13b: 30.1 (#298)

Coding benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 13b
LMArena Coding10391035
BigCodeBench Instruct29.6%—
BigCodeBench Complete40.6%—

Reasoning Too close to call

Phi 3 Mini 128k Instruct: 19.6 (#256), Wizardlm 13b: 19.4 (#259)

Reasoning benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 13b
LMArena Hard Prompts10281018

Math Phi 3 Mini 128k Instruct leads

Phi 3 Mini 128k Instruct: 31.6 (#222), Wizardlm 13b: 30.2 (#238)

Math benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 13b
LMArena Math10891017

Knowledge Not comparable

Phi 3 Mini 128k Instruct: 26.8 (#254), Wizardlm 13b: —

Knowledge benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 13b
LMArena Expert984—

Multilingual Wizardlm 13b leads

Phi 3 Mini 128k Instruct: 25.2 (#285), Wizardlm 13b: 27.1 (#277)

Multilingual benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 13b
LMArena Non-English10001034
LMArena Chinese10161023
LMArena French1039—
LMArena German1006—
LMArena Japanese899—
LMArena Korean856—
LMArena Russian1004—
LMArena Spanish1059—

Instruction Following Wizardlm 13b leads

Phi 3 Mini 128k Instruct: 51.8 (#294), Wizardlm 13b: 53.5 (#285)

Instruction Following benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 13b
LMArena Instruction Following10231048

Long Context Wizardlm 13b leads

Phi 3 Mini 128k Instruct: 30.4 (#289), Wizardlm 13b: 32.0 (#273)

Long Context benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 13b
LMArena Longer Query9961054

Writing & Preference Wizardlm 13b leads

Phi 3 Mini 128k Instruct: 27.1 (#301), Wizardlm 13b: 30.5 (#287)

Writing & Preference benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 13b
LMArena Text10501077
LMArena Creative Writing10241091
LMArena Multi-Turn9891047

Frequently asked questions

Is Phi 3 Mini 128k Instruct better than Wizardlm 13b?

Wizardlm 13b is the stronger model overall, scoring 31.4 to 29.7 on the Noometry Index.

Is Phi 3 Mini 128k Instruct or Wizardlm 13b better for coding?

Wizardlm 13b scores higher on coding benchmarks: 30.1 versus 28.8 in the Noometry coding category.

How many benchmarks do Phi 3 Mini 128k Instruct and Wizardlm 13b share?

10 benchmarks have published results for both models. Phi 3 Mini 128k Instruct has 19 scored results on Noometry and Wizardlm 13b has 10.

Related comparisons

Go deeper