Model comparison

Mercury 2.5 vs Muse Glimmer

Muse Glimmer is the stronger model overall, scoring 41.7 to 33.5 on the Noometry Index.

Last verified . 2 shared benchmarks.

Mercury 2.5 Inception

33.5

Rank #242 Reported

Muse Glimmer Meta

41.7

Rank #131 Confirmed

Summary

  • They share 2 benchmarks with published results for both. Mercury 2.5 scores higher in 0 categories and Muse Glimmer in 3 categories; 2 gaps are clear of the uncertainty.
  • The widest gap is in math, where Muse Glimmer leads 38.8 to 23.3.
  • The biggest single-benchmark swing is SciCode: 38.5% for Mercury 2.5 and 44.9% for Muse Glimmer.
  • Muse Glimmer has downloadable open weights; the other is API-only.

Side by side

Mercury 2.5 and Muse Glimmer specifications
Mercury 2.5Muse Glimmer
ProviderInceptionMeta
Noometry Index33.541.7
Released2026-09-082026-08-10
WeightsProprietaryOpen
Context window260K—
Max output66K—
Input $ / M tokens$0.04—
Output $ / M tokens$0.15—
Results tracked415

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

Mercury 2.5: 39.5 (#156), Muse Glimmer: 40.4 (#142)

Coding benchmarks
BenchmarkMercury 2.5Muse Glimmer
SciCode38.5%44.9%
LMArena WebDev—1355
LMArena Coding—1416
ALE-Bench301.65—

Reasoning Muse Glimmer leads

Mercury 2.5: 22.4 (#193), Muse Glimmer: 25.7 (#144)

Reasoning benchmarks
BenchmarkMercury 2.5Muse Glimmer
CritPt0%2.6%
LMArena Hard Prompts—1396

Math Muse Glimmer leads

Mercury 2.5: 23.3 (#272), Muse Glimmer: 38.8 (#125)

Math benchmarks
BenchmarkMercury 2.5Muse Glimmer
ProofBench3%—
LMArena Math—1417

Knowledge Not comparable

Mercury 2.5: —, Muse Glimmer: 38.5 (#143)

Knowledge benchmarks
BenchmarkMercury 2.5Muse Glimmer
LMArena Expert—1386

Multilingual Not comparable

Mercury 2.5: —, Muse Glimmer: 50.5 (#122)

Multilingual benchmarks
BenchmarkMercury 2.5Muse Glimmer
LMArena Non-English—1384
LMArena Chinese—1412
LMArena Russian—1390

Instruction Following Not comparable

Mercury 2.5: —, Muse Glimmer: 72.6 (#135)

Instruction Following benchmarks
BenchmarkMercury 2.5Muse Glimmer
LMArena Instruction Following—1375

Long Context Not comparable

Mercury 2.5: —, Muse Glimmer: 42.1 (#129)

Long Context benchmarks
BenchmarkMercury 2.5Muse Glimmer
LMArena Longer Query—1382

Writing & Preference Not comparable

Mercury 2.5: —, Muse Glimmer: 57.5 (#126)

Writing & Preference benchmarks
BenchmarkMercury 2.5Muse Glimmer
LMArena Text—1389
LMArena Creative Writing—1339
LMArena Multi-Turn—1399

Frequently asked questions

Is Mercury 2.5 better than Muse Glimmer?

Muse Glimmer is the stronger model overall, scoring 41.7 to 33.5 on the Noometry Index.

Is Mercury 2.5 or Muse Glimmer better for coding?

They score almost the same on coding (39.5 vs 40.4); test both on your own repository before choosing.

How many benchmarks do Mercury 2.5 and Muse Glimmer share?

2 benchmarks have published results for both models. Mercury 2.5 has 4 scored results on Noometry and Muse Glimmer has 15.

Related comparisons

Go deeper