Model comparison
Devstral Small 2505 vs Muse Glimmer
Muse Glimmer is the stronger model overall, scoring 41.7 to 34.3 on the Noometry Index.
Last verified . 2 shared benchmarks.
Summary
- They share 2 benchmarks with published results for both. Devstral Small 2505 scores higher in 0 categories and Muse Glimmer in 2 categories; 2 gaps are clear of the uncertainty.
- The widest gap is in reasoning, where Muse Glimmer leads 25.7 to 19.7.
- The biggest single-benchmark swing is SciCode: 28.8% for Devstral Small 2505 and 44.9% for Muse Glimmer.
Side by side
| Devstral Small 2505 | Muse Glimmer | |
|---|---|---|
| Provider | Mistral AI | Meta |
| Noometry Index | 34.3 | 41.7 |
| Released | 2025-05-07 | 2026-08-10 |
| Weights | Open | Open |
| Context window | 128K | — |
| Max output | 128K | — |
| Input $ / M tokens | $0.10 | — |
| Output $ / M tokens | $0.30 | — |
| Results tracked | 4 | 15 |
Sponsored placements are available on pages like this one. Advertise on Noometry
Category by category
Coding Muse Glimmer leads
Devstral Small 2505: 38.9 (#166), Muse Glimmer: 40.4 (#142)
| Benchmark | Devstral Small 2505 | Muse Glimmer |
|---|---|---|
| SciCode | 28.8% | 44.9% |
| SWE-bench Verified (bash only) | 56.4% | — |
| LMArena WebDev | — | 1355 |
| LMArena Coding | — | 1416 |
Reasoning Muse Glimmer leads
Devstral Small 2505: 19.7 (#252), Muse Glimmer: 25.7 (#144)
| Benchmark | Devstral Small 2505 | Muse Glimmer |
|---|---|---|
| CritPt | 0% | 2.6% |
| Kagi LLM Benchmark | 37.7% | — |
| LMArena Hard Prompts | — | 1396 |
Math Not comparable
Devstral Small 2505: —, Muse Glimmer: 38.8 (#125)
| Benchmark | Devstral Small 2505 | Muse Glimmer |
|---|---|---|
| LMArena Math | — | 1417 |
Knowledge Not comparable
Devstral Small 2505: —, Muse Glimmer: 38.5 (#143)
| Benchmark | Devstral Small 2505 | Muse Glimmer |
|---|---|---|
| LMArena Expert | — | 1386 |
Multilingual Not comparable
Devstral Small 2505: —, Muse Glimmer: 50.5 (#122)
| Benchmark | Devstral Small 2505 | Muse Glimmer |
|---|---|---|
| LMArena Non-English | — | 1384 |
| LMArena Chinese | — | 1412 |
| LMArena Russian | — | 1390 |
Instruction Following Not comparable
Devstral Small 2505: —, Muse Glimmer: 72.6 (#135)
| Benchmark | Devstral Small 2505 | Muse Glimmer |
|---|---|---|
| LMArena Instruction Following | — | 1375 |
Long Context Not comparable
Devstral Small 2505: —, Muse Glimmer: 42.1 (#129)
| Benchmark | Devstral Small 2505 | Muse Glimmer |
|---|---|---|
| LMArena Longer Query | — | 1382 |
Writing & Preference Not comparable
Devstral Small 2505: —, Muse Glimmer: 57.5 (#126)
| Benchmark | Devstral Small 2505 | Muse Glimmer |
|---|---|---|
| LMArena Text | — | 1389 |
| LMArena Creative Writing | — | 1339 |
| LMArena Multi-Turn | — | 1399 |
Frequently asked questions
Is Devstral Small 2505 better than Muse Glimmer?
Muse Glimmer is the stronger model overall, scoring 41.7 to 34.3 on the Noometry Index.
Is Devstral Small 2505 or Muse Glimmer better for coding?
Muse Glimmer scores higher on coding benchmarks: 40.4 versus 38.9 in the Noometry coding category.
How many benchmarks do Devstral Small 2505 and Muse Glimmer share?
2 benchmarks have published results for both models. Devstral Small 2505 has 4 scored results on Noometry and Muse Glimmer has 15.