Model comparison

Magistral Medium vs Phi-2

Magistral Medium has enough public results to be ranked (#227); Phi-2 does not yet, so treat this comparison as directional.

Last verified . 0 shared benchmarks.

Magistral Medium Mistral AI

35.2

Rank #227 Confirmed

Phi-2 Microsoft

—

Unranked

Side by side

Magistral Medium and Phi-2 specifications
Magistral MediumPhi-2
ProviderMistral AIMicrosoft
Noometry Index35.2—
Released2025-03-172023-12-12
WeightsOpenOpen
Context window262K—
Max output16K—
Input $ / M tokens$2—
Output $ / M tokens$5—
Results tracked2211

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Not comparable

Magistral Medium: 39.1 (#161), Phi-2: —

Coding benchmarks
BenchmarkMagistral MediumPhi-2
SciCode39.2%—
LMArena Coding1319—
HumanEval+—45.1%
MBPP+—54.2%

Reasoning Not comparable

Magistral Medium: 8.6 (#348), Phi-2: —

Reasoning benchmarks
BenchmarkMagistral MediumPhi-2
ARC-AGI-20%—
Kagi LLM Benchmark16.2%—
ARC-AGI-16.1%—
CritPt0.3%—
LMArena Hard Prompts1267—
Adversarial NLI—42.5%
BIG-Bench Hard—59.4%
Epoch Capabilities Index—107.94
HellaSwag—53.6%
WinoGrande—54.7%

Math Not comparable

Magistral Medium: 35.1 (#189), Phi-2: —

Math benchmarks
BenchmarkMagistral MediumPhi-2
LMArena Math1250—

Knowledge Not comparable

Magistral Medium: 33.5 (#202), Phi-2: —

Knowledge benchmarks
BenchmarkMagistral MediumPhi-2
LMArena Expert1223—
ARC (AI2) Challenge—75.9%
MMLU—58.4%
OpenBookQA—73.6%
TriviaQA—45.2%

Multilingual Not comparable

Magistral Medium: 39.6 (#224), Phi-2: —

Multilingual benchmarks
BenchmarkMagistral MediumPhi-2
LMArena Non-English1232—
LMArena Chinese1227—
LMArena French1267—
LMArena German1248—
LMArena Japanese1175—
LMArena Korean1125—
LMArena Russian1224—
LMArena Spanish1271—

Instruction Following Not comparable

Magistral Medium: 66.0 (#211), Phi-2: —

Instruction Following benchmarks
BenchmarkMagistral MediumPhi-2
LMArena Instruction Following1254—

Long Context Not comparable

Magistral Medium: 39.3 (#183), Phi-2: —

Long Context benchmarks
BenchmarkMagistral MediumPhi-2
LMArena Longer Query1295—

Writing & Preference Not comparable

Magistral Medium: 46.3 (#219), Phi-2: —

Writing & Preference benchmarks
BenchmarkMagistral MediumPhi-2
LMArena Text1255—
LMArena Creative Writing1245—
LMArena Multi-Turn1275—

Frequently asked questions

Is Magistral Medium better than Phi-2?

Magistral Medium has enough public results to be ranked (#227); Phi-2 does not yet, so treat this comparison as directional.

How many benchmarks do Magistral Medium and Phi-2 share?

0 benchmarks have published results for both models. Magistral Medium has 22 scored results on Noometry and Phi-2 has 11.

Related comparisons

Go deeper