Model comparison

Magistral Medium vs Qwen3.6 Plus

Qwen3.6 Plus is the stronger model overall, scoring 47.5 to 35.2 on the Noometry Index.

Last verified . 19 shared benchmarks.

Magistral Medium Mistral AI

35.2

Rank #227 Confirmed

Qwen3.6 Plus Alibaba (Qwen)

47.5

Rank #62 Confirmed

Summary

  • They share 19 benchmarks with published results for both. Magistral Medium scores higher in 0 categories and Qwen3.6 Plus in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Qwen3.6 Plus leads 56.1 to 33.5.
  • Qwen3.6 Plus is cheaper at $0.50 / $3 per million input/output tokens, against $2 / $5 for Magistral Medium.
  • Qwen3.6 Plus accepts more context: 1M tokens versus 262K.
  • Magistral Medium has downloadable open weights; the other is API-only.

Side by side

Magistral Medium and Qwen3.6 Plus specifications
Magistral MediumQwen3.6 Plus
ProviderMistral AIAlibaba (Qwen)
Noometry Index35.247.5
Released2025-03-172026-03-31
WeightsOpenProprietary
Context window262K1M
Max output16K66K
Input $ / M tokens$2$0.50
Output $ / M tokens$5$3
Results tracked2237

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Qwen3.6 Plus leads

Magistral Medium: 39.1 (#161), Qwen3.6 Plus: 40.8 (#130)

Coding benchmarks
BenchmarkMagistral MediumQwen3.6 Plus
SciCode39.2%40.7%
LMArena Coding13191467
SWE-bench Verified—57.9%
LMArena WebDev—1461
ALE-Bench—670.15

Agentic & Tool Use Not comparable

Magistral Medium: —, Qwen3.6 Plus: —

Agentic & Tool Use benchmarks
BenchmarkMagistral MediumQwen3.6 Plus
Vending-Bench 2—5,115

Reasoning Qwen3.6 Plus leads

Magistral Medium: 8.6 (#348), Qwen3.6 Plus: 29.3 (#93)

Reasoning benchmarks
BenchmarkMagistral MediumQwen3.6 Plus
CritPt0.3%2.9%
LMArena Hard Prompts12671449
ARC-AGI-20%—
Kagi LLM Benchmark16.2%—
NYT Connections (extended)—60.3%
ARC-AGI-16.1%—
Chess Puzzles—17%
Thematic Generalization—59.5%
Mystery Game Puzzles—12%
DTBench—81.9%
LMCA—33.1%
Epoch Capabilities Index—147.65

Math Qwen3.6 Plus leads

Magistral Medium: 35.1 (#189), Qwen3.6 Plus: 51.8 (#54)

Math benchmarks
BenchmarkMagistral MediumQwen3.6 Plus
LMArena Math12501450
FrontierMath (Tiers 1-3)—38.2%
OTIS Mock AIME 2024-2025—93.3%
FrontierMath (Feb 2025 set)—26.2%
FrontierMath Tier 4 (v1)—8.3%

Knowledge Qwen3.6 Plus leads

Magistral Medium: 33.5 (#202), Qwen3.6 Plus: 56.1 (#45)

Knowledge benchmarks
BenchmarkMagistral MediumQwen3.6 Plus
LMArena Expert12231454
GPQA Diamond—88.4%
SimpleQA Verified—44.1%

Multilingual Qwen3.6 Plus leads

Magistral Medium: 39.6 (#224), Qwen3.6 Plus: 53.3 (#70)

Multilingual benchmarks
BenchmarkMagistral MediumQwen3.6 Plus
LMArena Non-English12321424
LMArena Chinese12271477
LMArena French12671455
LMArena German12481452
LMArena Japanese11751389
LMArena Korean11251379
LMArena Russian12241434
LMArena Spanish12711432

Instruction Following Qwen3.6 Plus leads

Magistral Medium: 66.0 (#211), Qwen3.6 Plus: 75.0 (#74)

Instruction Following benchmarks
BenchmarkMagistral MediumQwen3.6 Plus
LMArena Instruction Following12541425

Long Context Qwen3.6 Plus leads

Magistral Medium: 39.3 (#183), Qwen3.6 Plus: 45.2 (#49)

Long Context benchmarks
BenchmarkMagistral MediumQwen3.6 Plus
LMArena Longer Query12951439
CL-bench—20.3%

Writing & Preference Qwen3.6 Plus leads

Magistral Medium: 46.3 (#219), Qwen3.6 Plus: 62.2 (#82)

Writing & Preference benchmarks
BenchmarkMagistral MediumQwen3.6 Plus
LMArena Text12551437
LMArena Creative Writing12451404
LMArena Multi-Turn12751438

Frequently asked questions

Is Magistral Medium better than Qwen3.6 Plus?

Qwen3.6 Plus is the stronger model overall, scoring 47.5 to 35.2 on the Noometry Index.

Which is cheaper, Magistral Medium or Qwen3.6 Plus?

Qwen3.6 Plus is cheaper. It lists at $0.50 per million input tokens and $3 per million output tokens; Magistral Medium lists at $2 and $5.

Is Magistral Medium or Qwen3.6 Plus better for coding?

Qwen3.6 Plus scores higher on coding benchmarks: 40.8 versus 39.1 in the Noometry coding category.

Which has the bigger context window?

Qwen3.6 Plus does, with 1M tokens against 262K.

How many benchmarks do Magistral Medium and Qwen3.6 Plus share?

19 benchmarks have published results for both models. Magistral Medium has 22 scored results on Noometry and Qwen3.6 Plus has 37.

Related comparisons

Go deeper