Model comparison

Muse Glimmer vs Qwen-14B

Muse Glimmer is the stronger model overall, scoring 41.7 to 31.4 on the Noometry Index.

Last verified . 10 shared benchmarks.

Muse Glimmer Meta

41.7

Rank #131 Confirmed

Qwen-14B Alibaba (Qwen)

31.4

Rank #275 Confirmed

Summary

  • They share 10 benchmarks with published results for both. Muse Glimmer scores higher in 7 categories and Qwen-14B in 0 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Muse Glimmer leads 57.5 to 27.6.

Side by side

Muse Glimmer and Qwen-14B specifications
Muse GlimmerQwen-14B
ProviderMetaAlibaba (Qwen)
Noometry Index41.731.4
Released2026-08-102023-09-24
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1518

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Glimmer leads

Muse Glimmer: 40.4 (#142), Qwen-14B: 31.2 (#288)

Coding benchmarks
BenchmarkMuse GlimmerQwen-14B
LMArena Coding14161071
LMArena WebDev1355—
SciCode44.9%—

Reasoning Muse Glimmer leads

Muse Glimmer: 25.7 (#144), Qwen-14B: 19.6 (#257)

Reasoning benchmarks
BenchmarkMuse GlimmerQwen-14B
LMArena Hard Prompts13961027
CritPt2.6%—
BIG-Bench Hard—55%
Epoch Capabilities Index—113.03
LAMBADA—71.1%
PIQA—79.9%

Math Muse Glimmer leads

Muse Glimmer: 38.8 (#125), Qwen-14B: 31.2 (#227)

Math benchmarks
BenchmarkMuse GlimmerQwen-14B
LMArena Math14171068
GSM8K—61.3%

Knowledge Not comparable

Muse Glimmer: 38.5 (#143), Qwen-14B: —

Knowledge benchmarks
BenchmarkMuse GlimmerQwen-14B
LMArena Expert1386—
ARC (AI2) Challenge—84.4%
BoolQ—86.2%
MMLU—66.3%

Multilingual Muse Glimmer leads

Muse Glimmer: 50.5 (#122), Qwen-14B: 27.5 (#275)

Multilingual benchmarks
BenchmarkMuse GlimmerQwen-14B
LMArena Non-English13841041
LMArena Chinese14121077
LMArena Russian1390—

Instruction Following Muse Glimmer leads

Muse Glimmer: 72.6 (#135), Qwen-14B: 52.4 (#289)

Instruction Following benchmarks
BenchmarkMuse GlimmerQwen-14B
LMArena Instruction Following13751031

Long Context Muse Glimmer leads

Muse Glimmer: 42.1 (#129), Qwen-14B: 31.3 (#280)

Long Context benchmarks
BenchmarkMuse GlimmerQwen-14B
LMArena Longer Query13821028

Writing & Preference Muse Glimmer leads

Muse Glimmer: 57.5 (#126), Qwen-14B: 27.6 (#299)

Writing & Preference benchmarks
BenchmarkMuse GlimmerQwen-14B
LMArena Text13891051
LMArena Creative Writing13391028
LMArena Multi-Turn13991022

Frequently asked questions

Is Muse Glimmer better than Qwen-14B?

Muse Glimmer is the stronger model overall, scoring 41.7 to 31.4 on the Noometry Index.

Is Muse Glimmer or Qwen-14B better for coding?

Muse Glimmer scores higher on coding benchmarks: 40.4 versus 31.2 in the Noometry coding category.

How many benchmarks do Muse Glimmer and Qwen-14B share?

10 benchmarks have published results for both models. Muse Glimmer has 15 scored results on Noometry and Qwen-14B has 18.

Related comparisons

Go deeper