Model comparison

Muse Glimmer vs Qwen2.5 7B Instruct

Muse Glimmer is the stronger model overall, scoring 41.7 to 29.0 on the Noometry Index.

Last verified . 0 shared benchmarks.

Muse Glimmer Meta

41.7

Rank #131 Confirmed

Qwen2.5 7B Instruct Alibaba (Qwen)

29.0

Rank #320 Confirmed

Summary

  • The widest gap is in math, where Muse Glimmer leads 38.8 to 12.6.

Side by side

Muse Glimmer and Qwen2.5 7B Instruct specifications
Muse GlimmerQwen2.5 7B Instruct
ProviderMetaAlibaba (Qwen)
Noometry Index41.729.0
Released2026-08-102024-09
WeightsOpenOpen
Context window—131K
Max output—8K
Input $ / M tokens—$0.17
Output $ / M tokens—$0.70
Results tracked1515

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Glimmer leads

Muse Glimmer: 40.4 (#142), Qwen2.5 7B Instruct: 36.5 (#208)

Coding benchmarks
BenchmarkMuse GlimmerQwen2.5 7B Instruct
LMArena WebDev1355—
SciCode44.9%—
BigCodeBench Instruct—37.6%
LMArena Coding1416—
BigCodeBench Complete—46.1%

Agentic & Tool Use Not comparable

Muse Glimmer: —, Qwen2.5 7B Instruct: 23.8 (#124)

Agentic & Tool Use benchmarks
BenchmarkMuse GlimmerQwen2.5 7B Instruct
BALROG—7.8%

Reasoning Muse Glimmer leads

Muse Glimmer: 25.7 (#144), Qwen2.5 7B Instruct: 14.8 (#322)

Reasoning benchmarks
BenchmarkMuse GlimmerQwen2.5 7B Instruct
CritPt2.6%—
Chess Puzzles—0%
LMArena Hard Prompts1396—
DTBench—47.7%
LMCA—6.4%
Epoch Capabilities Index—118.51

Math Muse Glimmer leads

Muse Glimmer: 38.8 (#125), Qwen2.5 7B Instruct: 12.6 (#306)

Math benchmarks
BenchmarkMuse GlimmerQwen2.5 7B Instruct
OTIS Mock AIME 2024-2025—2.5%
Omni-MATH—29.4%
LMArena Math1417—

Knowledge Muse Glimmer leads

Muse Glimmer: 38.5 (#143), Qwen2.5 7B Instruct: 17.0 (#286)

Knowledge benchmarks
BenchmarkMuse GlimmerQwen2.5 7B Instruct
GPQA Diamond—35.5%
MMLU-Pro—53.9%
GPQA (HELM)—34.1%
LMArena Expert1386—
MMLU—72.9%

Multilingual Not comparable

Muse Glimmer: 50.5 (#122), Qwen2.5 7B Instruct: —

Multilingual benchmarks
BenchmarkMuse GlimmerQwen2.5 7B Instruct
LMArena Non-English1384—
LMArena Chinese1412—
LMArena Russian1390—

Instruction Following Muse Glimmer leads

Muse Glimmer: 72.6 (#135), Qwen2.5 7B Instruct: 63.2 (#231)

Instruction Following benchmarks
BenchmarkMuse GlimmerQwen2.5 7B Instruct
IFEval—74.1%
LMArena Instruction Following1375—

Long Context Not comparable

Muse Glimmer: 42.1 (#129), Qwen2.5 7B Instruct: —

Long Context benchmarks
BenchmarkMuse GlimmerQwen2.5 7B Instruct
LMArena Longer Query1382—

Writing & Preference Muse Glimmer leads

Muse Glimmer: 57.5 (#126), Qwen2.5 7B Instruct: 48.8 (#195)

Writing & Preference benchmarks
BenchmarkMuse GlimmerQwen2.5 7B Instruct
LMArena Text1389—
LMArena Creative Writing1339—
WildBench—73.1%
LMArena Multi-Turn1399—

Frequently asked questions

Is Muse Glimmer better than Qwen2.5 7B Instruct?

Muse Glimmer is the stronger model overall, scoring 41.7 to 29.0 on the Noometry Index.

Is Muse Glimmer or Qwen2.5 7B Instruct better for coding?

Muse Glimmer scores higher on coding benchmarks: 40.4 versus 36.5 in the Noometry coding category.

How many benchmarks do Muse Glimmer and Qwen2.5 7B Instruct share?

0 benchmarks have published results for both models. Muse Glimmer has 15 scored results on Noometry and Qwen2.5 7B Instruct has 15.

Related comparisons

Go deeper