# Magistral Medium vs Qwen3 Max

> Qwen3 Max is the stronger model overall, scoring 43.7 to 35.2 on the Noometry Index.

- Canonical page: https://noometry.com/compare/magistral-medium-vs-qwen3-max
- Last updated: 2026-10-11
- Shared benchmarks: 18

## Summary

- They share 18 benchmarks with published results for both. Magistral Medium scores higher in 0 categories and Qwen3 Max in 8 categories; 8 gaps are clear of the uncertainty.
- The widest gap is in writing & preference, where Qwen3 Max leads 62.4 to 46.3.
- The biggest single-benchmark swing is Kagi LLM Benchmark: 16.2% for Magistral Medium and 72.5% for Qwen3 Max.
- Qwen3 Max is cheaper at $1.20 / $6 per million input/output tokens, against $2 / $5 for Magistral Medium.
- Magistral Medium has downloadable open weights; the other is API-only.

## Snapshot

| | Magistral Medium | Qwen3 Max |
|---|---|---|
| Provider | Mistral AI | Alibaba (Qwen) |
| Noometry Index | 35.2 | 43.7 |
| Rank | 227 | 87 |
| Context | 262K | 262K |
| Input $/M | $2 | $1.20 |
| Output $/M | $5 | $6 |
| Weights | Open | Proprietary |

## Coding

- Magistral Medium: 39.1 (#161)
- Qwen3 Max: 43.0 (#93)

| Benchmark | Magistral Medium | Qwen3 Max |
|---|---|---|
| LMArena Coding | 1319 | 1456 |
| SciCode | 39.2% | — |
| ALE-Bench | — | 370.45 |

## Agentic & Tool Use

- Magistral Medium: —
- Qwen3 Max: —

| Benchmark | Magistral Medium | Qwen3 Max |
|---|---|---|
| Vending-Bench 2 | — | 71.56 |

## Reasoning

- Magistral Medium: 8.6 (#348)
- Qwen3 Max: 22.6 (#190)

| Benchmark | Magistral Medium | Qwen3 Max |
|---|---|---|
| Kagi LLM Benchmark | 16.2% | 72.5% |
| LMArena Hard Prompts | 1267 | 1448 |
| ARC-AGI-2 | 0% | — |
| NYT Connections (extended) | — | 30.1% |
| ARC-AGI-1 | 6.1% | — |
| CritPt | 0.3% | — |
| Chess Puzzles | — | 4% |
| Mystery Game Puzzles | — | 5% |
| DTBench | — | 82.1% |
| LMCA | — | 28.3% |
| Epoch Capabilities Index | — | 142.38 |

## Math

- Magistral Medium: 35.1 (#189)
- Qwen3 Max: 38.7 (#131)

| Benchmark | Magistral Medium | Qwen3 Max |
|---|---|---|
| LMArena Math | 1250 | 1446 |
| FrontierMath (Tiers 1-3) | — | 18.9% |
| OTIS Mock AIME 2024-2025 | — | 73.3% |
| MATH Level 5 | — | 97.1% |

## Knowledge

- Magistral Medium: 33.5 (#202)
- Qwen3 Max: 48.1 (#78)

| Benchmark | Magistral Medium | Qwen3 Max |
|---|---|---|
| LMArena Expert | 1223 | 1455 |
| GPQA Diamond | — | 72.6% |
| SimpleQA Verified | — | 48.7% |

## Multilingual

- Magistral Medium: 39.6 (#224)
- Qwen3 Max: 53.7 (#62)

| Benchmark | Magistral Medium | Qwen3 Max |
|---|---|---|
| LMArena Non-English | 1232 | 1429 |
| LMArena Chinese | 1227 | 1478 |
| LMArena French | 1267 | 1449 |
| LMArena German | 1248 | 1463 |
| LMArena Japanese | 1175 | 1397 |
| LMArena Korean | 1125 | 1399 |
| LMArena Russian | 1224 | 1428 |
| LMArena Spanish | 1271 | 1462 |

## Instruction Following

- Magistral Medium: 66.0 (#211)
- Qwen3 Max: 74.8 (#87)

| Benchmark | Magistral Medium | Qwen3 Max |
|---|---|---|
| LMArena Instruction Following | 1254 | 1419 |

## Long Context

- Magistral Medium: 39.3 (#183)
- Qwen3 Max: 41.6 (#134)

| Benchmark | Magistral Medium | Qwen3 Max |
|---|---|---|
| LMArena Longer Query | 1295 | 1438 |
| Fiction.LiveBench | — | 66.7% |
| CL-bench | — | 14.5% |

## Writing & Preference

- Magistral Medium: 46.3 (#219)
- Qwen3 Max: 62.4 (#76)

| Benchmark | Magistral Medium | Qwen3 Max |
|---|---|---|
| LMArena Text | 1255 | 1439 |
| LMArena Creative Writing | 1245 | 1402 |
| LMArena Multi-Turn | 1275 | 1446 |

## FAQ

### Is Magistral Medium better than Qwen3 Max?

Qwen3 Max is the stronger model overall, scoring 43.7 to 35.2 on the Noometry Index.

### Which is cheaper, Magistral Medium or Qwen3 Max?

Qwen3 Max is cheaper. It lists at $1.20 per million input tokens and $6 per million output tokens; Magistral Medium lists at $2 and $5.

### Is Magistral Medium or Qwen3 Max better for coding?

Qwen3 Max scores higher on coding benchmarks: 43.0 versus 39.1 in the Noometry coding category.

### Which has the bigger context window?

Both accept 262K tokens.

### How many benchmarks do Magistral Medium and Qwen3 Max share?

18 benchmarks have published results for both models. Magistral Medium has 22 scored results on Noometry and Qwen3 Max has 33.
