Model comparison

Mistral Small 3 vs Muse Glimmer

Muse Glimmer is the stronger model overall, scoring 41.7 to 31.2 on the Noometry Index.

Last verified . 12 shared benchmarks.

Mistral Small 3 Mistral AI

31.2

Rank #278 Confirmed

Muse Glimmer Meta

41.7

Rank #131 Confirmed

Summary

  • They share 12 benchmarks with published results for both. Mistral Small 3 scores higher in 0 categories and Muse Glimmer in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Muse Glimmer leads 57.5 to 32.2.

Side by side

Mistral Small 3 and Muse Glimmer specifications
Mistral Small 3Muse Glimmer
ProviderMistral AIMeta
Noometry Index31.241.7
Released2025-01-302026-08-10
WeightsOpenOpen
Context window33K—
Max output16K—
Input $ / M tokens$0.05—
Output $ / M tokens$0.08—
Results tracked2415

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Glimmer leads

Mistral Small 3: 36.5 (#207), Muse Glimmer: 40.4 (#142)

Coding benchmarks
BenchmarkMistral Small 3Muse Glimmer
LMArena Coding12461416
LMArena WebDev—1355
SciCode—44.9%
BigCodeBench Instruct45.3%—
BigCodeBench Complete50.4%—

Reasoning Muse Glimmer leads

Mistral Small 3: 18.9 (#273), Muse Glimmer: 25.7 (#144)

Reasoning benchmarks
BenchmarkMistral Small 3Muse Glimmer
LMArena Hard Prompts12331396
CritPt—2.6%
Chess Puzzles0%—
Epoch Capabilities Index127.07—

Math Muse Glimmer leads

Mistral Small 3: 16.3 (#295), Muse Glimmer: 38.8 (#125)

Math benchmarks
BenchmarkMistral Small 3Muse Glimmer
LMArena Math12401417
OTIS Mock AIME 2024-20256.7%—

Knowledge Muse Glimmer leads

Mistral Small 3: 25.1 (#263), Muse Glimmer: 38.5 (#143)

Knowledge benchmarks
BenchmarkMistral Small 3Muse Glimmer
LMArena Expert12021386
GPQA Diamond47.3%—
Confabulations25.2%—

Multilingual Muse Glimmer leads

Mistral Small 3: 37.3 (#236), Muse Glimmer: 50.5 (#122)

Multilingual benchmarks
BenchmarkMistral Small 3Muse Glimmer
LMArena Non-English11981384
LMArena Chinese12041412
LMArena Russian12161390
LMArena French1203—
LMArena German1211—
LMArena Japanese1111—
LMArena Korean1188—

Instruction Following Muse Glimmer leads

Mistral Small 3: 63.7 (#229), Muse Glimmer: 72.6 (#135)

Instruction Following benchmarks
BenchmarkMistral Small 3Muse Glimmer
LMArena Instruction Following12141375

Long Context Muse Glimmer leads

Mistral Small 3: 37.8 (#211), Muse Glimmer: 42.1 (#129)

Long Context benchmarks
BenchmarkMistral Small 3Muse Glimmer
LMArena Longer Query12461382

Writing & Preference Muse Glimmer leads

Mistral Small 3: 32.2 (#280), Muse Glimmer: 57.5 (#126)

Writing & Preference benchmarks
BenchmarkMistral Small 3Muse Glimmer
LMArena Text12341389
LMArena Creative Writing11951339
LMArena Multi-Turn12171399
EQ-Bench Creative Writing707—

Frequently asked questions

Is Mistral Small 3 better than Muse Glimmer?

Muse Glimmer is the stronger model overall, scoring 41.7 to 31.2 on the Noometry Index.

Is Mistral Small 3 or Muse Glimmer better for coding?

Muse Glimmer scores higher on coding benchmarks: 40.4 versus 36.5 in the Noometry coding category.

How many benchmarks do Mistral Small 3 and Muse Glimmer share?

12 benchmarks have published results for both models. Mistral Small 3 has 24 scored results on Noometry and Muse Glimmer has 15.

Related comparisons

Go deeper