Model comparison

Phi 3 Mini 128k Instruct vs Wizardlm 70b

Wizardlm 70b is the stronger model overall, scoring 33.0 to 29.7 on the Noometry Index.

Last verified . 12 shared benchmarks.

Phi 3 Mini 128k Instruct Microsoft

29.7

Rank #305 Confirmed

Wizardlm 70b Microsoft

33.0

Rank #249 Confirmed

Summary

  • They share 12 benchmarks with published results for both. Phi 3 Mini 128k Instruct scores higher in 0 categories and Wizardlm 70b in 7 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Wizardlm 70b leads 34.8 to 27.1.

Side by side

Phi 3 Mini 128k Instruct and Wizardlm 70b specifications
Phi 3 Mini 128k InstructWizardlm 70b
ProviderMicrosoftMicrosoft
Noometry Index29.733.0
Released2024-04-23—
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1912

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Wizardlm 70b leads

Phi 3 Mini 128k Instruct: 28.8 (#312), Wizardlm 70b: 31.4 (#285)

Coding benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 70b
LMArena Coding10391081
BigCodeBench Instruct29.6%—
BigCodeBench Complete40.6%—

Reasoning Wizardlm 70b leads

Phi 3 Mini 128k Instruct: 19.6 (#256), Wizardlm 70b: 20.7 (#234)

Reasoning benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 70b
LMArena Hard Prompts10281079

Math Too close to call

Phi 3 Mini 128k Instruct: 31.6 (#222), Wizardlm 70b: 32.2 (#218)

Math benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 70b
LMArena Math10891116

Knowledge Not comparable

Phi 3 Mini 128k Instruct: 26.8 (#254), Wizardlm 70b: —

Knowledge benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 70b
LMArena Expert984—

Multilingual Wizardlm 70b leads

Phi 3 Mini 128k Instruct: 25.2 (#285), Wizardlm 70b: 29.6 (#265)

Multilingual benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 70b
LMArena Non-English10001078
LMArena Chinese10161052
LMArena German10061083
LMArena Russian10041155
LMArena French1039—
LMArena Japanese899—
LMArena Korean856—
LMArena Spanish1059—

Instruction Following Wizardlm 70b leads

Phi 3 Mini 128k Instruct: 51.8 (#294), Wizardlm 70b: 56.3 (#273)

Instruction Following benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 70b
LMArena Instruction Following10231093

Long Context Wizardlm 70b leads

Phi 3 Mini 128k Instruct: 30.4 (#289), Wizardlm 70b: 33.3 (#263)

Long Context benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 70b
LMArena Longer Query9961097

Writing & Preference Wizardlm 70b leads

Phi 3 Mini 128k Instruct: 27.1 (#301), Wizardlm 70b: 34.8 (#269)

Writing & Preference benchmarks
BenchmarkPhi 3 Mini 128k InstructWizardlm 70b
LMArena Text10501120
LMArena Creative Writing10241149
LMArena Multi-Turn9891108

Frequently asked questions

Is Phi 3 Mini 128k Instruct better than Wizardlm 70b?

Wizardlm 70b is the stronger model overall, scoring 33.0 to 29.7 on the Noometry Index.

Is Phi 3 Mini 128k Instruct or Wizardlm 70b better for coding?

Wizardlm 70b scores higher on coding benchmarks: 31.4 versus 28.8 in the Noometry coding category.

How many benchmarks do Phi 3 Mini 128k Instruct and Wizardlm 70b share?

12 benchmarks have published results for both models. Phi 3 Mini 128k Instruct has 19 scored results on Noometry and Wizardlm 70b has 12.

Related comparisons

Go deeper