Model comparison

Mistral Medium vs Muse Glimmer

Muse Glimmer is the stronger model overall, scoring 41.7 to 36.3 on the Noometry Index.

Last verified . 14 shared benchmarks.

Mistral Medium Mistral AI

36.3

Rank #218 Confirmed

Muse Glimmer Meta

41.7

Rank #131 Confirmed

Summary

  • They share 14 benchmarks with published results for both. Mistral Medium scores higher in 4 categories and Muse Glimmer in 4 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Muse Glimmer leads 38.5 to 25.0.

Side by side

Mistral Medium and Muse Glimmer specifications
Mistral MediumMuse Glimmer
ProviderMistral AIMeta
Noometry Index36.341.7
Released2023-12-112026-08-10
WeightsOpenOpen
Context window262K—
Max output262K—
Input $ / M tokens$1.50—
Output $ / M tokens$7.50—
Results tracked3615

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Glimmer leads

Mistral Medium: 34.2 (#243), Muse Glimmer: 40.4 (#142)

Coding benchmarks
BenchmarkMistral MediumMuse Glimmer
SciCode40.2%44.9%
LMArena Coding14341416
FrontierCode8%—
LMArena WebDev—1355
WeirdML43.7%—
ALE-Bench763.98—

Agentic & Tool Use Not comparable

Mistral Medium: 28.3 (#90), Muse Glimmer: —

Agentic & Tool Use benchmarks
BenchmarkMistral MediumMuse Glimmer
Berkeley Function Calling Leaderboard37.7%—

Reasoning Muse Glimmer leads

Mistral Medium: 24.0 (#167), Muse Glimmer: 25.7 (#144)

Reasoning benchmarks
BenchmarkMistral MediumMuse Glimmer
CritPt0%2.6%
LMArena Hard Prompts14261396
Kagi LLM Benchmark50%—
DTBench75.5%—
LMCA26.1%—
Surface Evolver Bench26.9%—

Math Muse Glimmer leads

Mistral Medium: 28.1 (#245), Muse Glimmer: 38.8 (#125)

Math benchmarks
BenchmarkMistral MediumMuse Glimmer
LMArena Math14081417
OTIS Mock AIME 2024-202532.2%—
ProofBench9%—
MATH Level 581.6%—
FrontierMath (Feb 2025 set)0.3%—

Knowledge Muse Glimmer leads

Mistral Medium: 25.0 (#265), Muse Glimmer: 38.5 (#143)

Knowledge benchmarks
BenchmarkMistral MediumMuse Glimmer
LMArena Expert14081386
GPQA Diamond59.5%—
Humanity's Last Exam4.5%—
Vectara Hallucination Rate22.7%—

Multimodal Not comparable

Mistral Medium: 35.3 (#88), Muse Glimmer: —

Multimodal benchmarks
BenchmarkMistral MediumMuse Glimmer
LMArena Vision1172—

Multilingual Mistral Medium leads

Mistral Medium: 52.1 (#91), Muse Glimmer: 50.5 (#122)

Multilingual benchmarks
BenchmarkMistral MediumMuse Glimmer
LMArena Non-English14081384
LMArena Chinese14471412
LMArena Russian14111390
LMArena French1459—
LMArena German1432—
LMArena Japanese1378—
LMArena Korean1380—
LMArena Spanish1433—

Instruction Following Mistral Medium leads

Mistral Medium: 73.7 (#116), Muse Glimmer: 72.6 (#135)

Instruction Following benchmarks
BenchmarkMistral MediumMuse Glimmer
LMArena Instruction Following13981375

Long Context Too close to call

Mistral Medium: 42.9 (#114), Muse Glimmer: 42.1 (#129)

Long Context benchmarks
BenchmarkMistral MediumMuse Glimmer
LMArena Longer Query14061382

Writing & Preference Mistral Medium leads

Mistral Medium: 60.0 (#103), Muse Glimmer: 57.5 (#126)

Writing & Preference benchmarks
BenchmarkMistral MediumMuse Glimmer
LMArena Text14241389
LMArena Creative Writing13911339
LMArena Multi-Turn14181399
Short-Story Creative Writing77.3%—

Frequently asked questions

Is Mistral Medium better than Muse Glimmer?

Muse Glimmer is the stronger model overall, scoring 41.7 to 36.3 on the Noometry Index.

Is Mistral Medium or Muse Glimmer better for coding?

Muse Glimmer scores higher on coding benchmarks: 40.4 versus 34.2 in the Noometry coding category.

How many benchmarks do Mistral Medium and Muse Glimmer share?

14 benchmarks have published results for both models. Mistral Medium has 36 scored results on Noometry and Muse Glimmer has 15.

Related comparisons

Go deeper