Model comparison

Llama 13b vs Muse Glimmer

Muse Glimmer is the stronger model overall, scoring 41.7 to 24.4 on the Noometry Index.

Last verified . 8 shared benchmarks.

Llama 13b Meta

24.4

Rank #348 Confirmed

Muse Glimmer Meta

41.7

Rank #131 Confirmed

Summary

  • They share 8 benchmarks with published results for both. Llama 13b scores higher in 0 categories and Muse Glimmer in 6 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Muse Glimmer leads 57.5 to 13.8.

Side by side

Llama 13b and Muse Glimmer specifications
Llama 13bMuse Glimmer
ProviderMetaMeta
Noometry Index24.441.7
Released2023-02-242026-08-10
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked2115

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Glimmer leads

Llama 13b: 21.4 (#337), Muse Glimmer: 40.4 (#142)

Coding benchmarks
BenchmarkLlama 13bMuse Glimmer
LMArena Coding6831416
LMArena WebDev—1355
SciCode—44.9%

Reasoning Muse Glimmer leads

Llama 13b: 14.0 (#329), Muse Glimmer: 25.7 (#144)

Reasoning benchmarks
BenchmarkLlama 13bMuse Glimmer
LMArena Hard Prompts7281396
CritPt—2.6%
BIG-Bench Hard37.9%—
Epoch Capabilities Index100.58—
HellaSwag79.2%—
LAMBADA75.2%—
PIQA80.1%—
WinoGrande73%—

Math Muse Glimmer leads

Llama 13b: 26.7 (#256), Muse Glimmer: 38.8 (#125)

Math benchmarks
BenchmarkLlama 13bMuse Glimmer
LMArena Math8381417
GSM8K20.6%—

Knowledge Not comparable

Llama 13b: —, Muse Glimmer: 38.5 (#143)

Knowledge benchmarks
BenchmarkLlama 13bMuse Glimmer
LMArena Expert—1386
ARC (AI2) Challenge52.7%—
BoolQ78.7%—
MMLU47.7%—
OpenBookQA56.4%—
TriviaQA77.9%—

Multimodal Not comparable

Llama 13b: —, Muse Glimmer: —

Multimodal benchmarks
BenchmarkLlama 13bMuse Glimmer
ScienceQA43.3%—

Multilingual Muse Glimmer leads

Llama 13b: 16.6 (#297), Muse Glimmer: 50.5 (#122)

Multilingual benchmarks
BenchmarkLlama 13bMuse Glimmer
LMArena Non-English8191384
LMArena Chinese—1412
LMArena Russian—1390

Instruction Following Muse Glimmer leads

Llama 13b: 36.7 (#305), Muse Glimmer: 72.6 (#135)

Instruction Following benchmarks
BenchmarkLlama 13bMuse Glimmer
LMArena Instruction Following7811375

Long Context Not comparable

Llama 13b: —, Muse Glimmer: 42.1 (#129)

Long Context benchmarks
BenchmarkLlama 13bMuse Glimmer
LMArena Longer Query—1382

Writing & Preference Muse Glimmer leads

Llama 13b: 13.8 (#312), Muse Glimmer: 57.5 (#126)

Writing & Preference benchmarks
BenchmarkLlama 13bMuse Glimmer
LMArena Text8341389
LMArena Creative Writing7941339
LMArena Multi-Turn7531399

Frequently asked questions

Is Llama 13b better than Muse Glimmer?

Muse Glimmer is the stronger model overall, scoring 41.7 to 24.4 on the Noometry Index.

Is Llama 13b or Muse Glimmer better for coding?

Muse Glimmer scores higher on coding benchmarks: 40.4 versus 21.4 in the Noometry coding category.

How many benchmarks do Llama 13b and Muse Glimmer share?

8 benchmarks have published results for both models. Llama 13b has 21 scored results on Noometry and Muse Glimmer has 15.

Related comparisons

Go deeper