Model comparison

Claude 3.5 Sonnet vs Muse Glimmer

Muse Glimmer is the stronger model overall, scoring 41.7 to 34.6 on the Noometry Index.

Last verified . 12 shared benchmarks.

Claude 3.5 Sonnet Anthropic

34.6

Rank #231 Confirmed

Muse Glimmer Meta

41.7

Rank #131 Confirmed

Summary

  • They share 12 benchmarks with published results for both. Claude 3.5 Sonnet scores higher in 0 categories and Muse Glimmer in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Muse Glimmer leads 38.8 to 19.2.
  • Muse Glimmer has downloadable open weights; the other is API-only.

Side by side

Claude 3.5 Sonnet and Muse Glimmer specifications
Claude 3.5 SonnetMuse Glimmer
ProviderAnthropicMeta
Noometry Index34.641.7
Released2024-06-202026-08-10
WeightsProprietaryOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked6015

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Glimmer leads

Claude 3.5 Sonnet: 39.0 (#165), Muse Glimmer: 40.4 (#142)

Coding benchmarks
BenchmarkClaude 3.5 SonnetMuse Glimmer
LMArena Coding13421416
Aider Polyglot51.6%—
LMArena WebDev—1355
SciCode—44.9%
GSO4.6%—
WeirdML40%—
BigCodeBench Instruct46.8%—
LiveBench Coding67.1%—
BigCodeBench Complete58.6%—
CadEval48%—
HumanEval+81.7%—
MBPP+74.3%—

Agentic & Tool Use Not comparable

Claude 3.5 Sonnet: 32.3 (#67), Muse Glimmer: —

Agentic & Tool Use benchmarks
BenchmarkClaude 3.5 SonnetMuse Glimmer
TheAgentCompany24%—
Cybench17.5%—
BALROG32.6%—
METR Time Horizons45.2%—

Reasoning Muse Glimmer leads

Claude 3.5 Sonnet: 23.1 (#183), Muse Glimmer: 25.7 (#144)

Reasoning benchmarks
BenchmarkClaude 3.5 SonnetMuse Glimmer
LMArena Hard Prompts13051396
SimpleBench41.4%—
CritPt—2.6%
EnigmaEval0.9%—
LiveBench Reasoning56.7%—
DTBench67.8%—
LiveBench Data Analysis55%—
Epoch Capabilities Index133.55—
ForecastBench60.7—
LiveBench59%—

Math Muse Glimmer leads

Claude 3.5 Sonnet: 19.2 (#288), Muse Glimmer: 38.8 (#125)

Math benchmarks
BenchmarkClaude 3.5 SonnetMuse Glimmer
LMArena Math13071417
OTIS Mock AIME 2024-20258.5%—
Omni-MATH27.6%—
LiveBench Math52.3%—
MATH Level 556.9%—
FrontierMath (Feb 2025 set)2.1%—
FrontierMath Tier 4 (v1)0%—

Knowledge Muse Glimmer leads

Claude 3.5 Sonnet: 28.6 (#245), Muse Glimmer: 38.5 (#143)

Knowledge benchmarks
BenchmarkClaude 3.5 SonnetMuse Glimmer
LMArena Expert12651386
GPQA Diamond55.3%—
Humanity's Last Exam4.1%—
MMLU-Pro77.7%—
Confabulations19.9%—
GPQA (HELM)56.5%—
MMLU87.3%—

Multimodal Not comparable

Claude 3.5 Sonnet: 26.5 (#120), Muse Glimmer: —

Multimodal benchmarks
BenchmarkClaude 3.5 SonnetMuse Glimmer
LMArena Vision1125—
Video-MME60%—
GeoBench62%—
VPCT33%—

Multilingual Muse Glimmer leads

Claude 3.5 Sonnet: 43.2 (#185), Muse Glimmer: 50.5 (#122)

Multilingual benchmarks
BenchmarkClaude 3.5 SonnetMuse Glimmer
LMArena Non-English12831384
LMArena Chinese12721412
LMArena Russian13061390
LMArena French1305—
LMArena German1297—
LMArena Japanese1234—
LMArena Korean1200—
LMArena Spanish1290—

Instruction Following Muse Glimmer leads

Claude 3.5 Sonnet: 68.8 (#182), Muse Glimmer: 72.6 (#135)

Instruction Following benchmarks
BenchmarkClaude 3.5 SonnetMuse Glimmer
LMArena Instruction Following12971375
LiveBench Instruction Following69.3%—
IFEval85.5%—

Long Context Muse Glimmer leads

Claude 3.5 Sonnet: 39.9 (#167), Muse Glimmer: 42.1 (#129)

Long Context benchmarks
BenchmarkClaude 3.5 SonnetMuse Glimmer
LMArena Longer Query13111382

Writing & Preference Muse Glimmer leads

Claude 3.5 Sonnet: 52.9 (#164), Muse Glimmer: 57.5 (#126)

Writing & Preference benchmarks
BenchmarkClaude 3.5 SonnetMuse Glimmer
LMArena Text12981389
LMArena Creative Writing12921339
LMArena Multi-Turn13261399
Short-Story Creative Writing80.3%—
EQ-Bench Creative Writing1451—
WildBench79.2%—
LiveBench Language53.8%—

Frequently asked questions

Is Claude 3.5 Sonnet better than Muse Glimmer?

Muse Glimmer is the stronger model overall, scoring 41.7 to 34.6 on the Noometry Index.

Is Claude 3.5 Sonnet or Muse Glimmer better for coding?

Muse Glimmer scores higher on coding benchmarks: 40.4 versus 39.0 in the Noometry coding category.

How many benchmarks do Claude 3.5 Sonnet and Muse Glimmer share?

12 benchmarks have published results for both models. Claude 3.5 Sonnet has 60 scored results on Noometry and Muse Glimmer has 15.

Related comparisons

Go deeper