Model comparison

Claude Sonnet 5.5 vs Muse Glimmer

Claude Sonnet 5.5 is the stronger model overall, scoring 61.9 to 41.7 on the Noometry Index.

Last verified . 15 shared benchmarks.

Claude Sonnet 5.5 Anthropic

61.9

Rank #10 Confirmed

Muse Glimmer Meta

41.7

Rank #131 Confirmed

Summary

  • They share 15 benchmarks with published results for both. Claude Sonnet 5.5 scores higher in 8 categories and Muse Glimmer in 0 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Claude Sonnet 5.5 leads 87.9 to 38.8.
  • The biggest single-benchmark swing is CritPt: 31.4% for Claude Sonnet 5.5 and 2.6% for Muse Glimmer.
  • Muse Glimmer has downloadable open weights; the other is API-only.

Side by side

Claude Sonnet 5.5 and Muse Glimmer specifications
Claude Sonnet 5.5Muse Glimmer
ProviderAnthropicMeta
Noometry Index61.941.7
Released2026-09-282026-08-10
WeightsProprietaryOpen
Context window1M—
Max output128K—
Input $ / M tokens$2—
Output $ / M tokens$10—
Results tracked3215

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 67.3 (#6), Muse Glimmer: 40.4 (#142)

Coding benchmarks
BenchmarkClaude Sonnet 5.5Muse Glimmer
LMArena WebDev17741355
SciCode61%44.9%
LMArena Coding15131416
FrontierCode52.1%—
CursorBench55.5%—
FrontierSWE61.9%—
ALE-Bench1,819—

Agentic & Tool Use Not comparable

Claude Sonnet 5.5: 45.0 (#16), Muse Glimmer: —

Agentic & Tool Use benchmarks
BenchmarkClaude Sonnet 5.5Muse Glimmer
APEX-Agents75.5%—

Reasoning Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 54.0 (#28), Muse Glimmer: 25.7 (#144)

Reasoning benchmarks
BenchmarkClaude Sonnet 5.5Muse Glimmer
CritPt31.4%2.6%
LMArena Hard Prompts14951396
NYT Connections (extended)80.5%—
Mystery Game Puzzles65%—
Epoch Capabilities Index165.03—

Math Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 87.9 (#6), Muse Glimmer: 38.8 (#125)

Math benchmarks
BenchmarkClaude Sonnet 5.5Muse Glimmer
LMArena Math15101417
FrontierMath (Tiers 1-3)88.8%—
FrontierMath Tier 480.5%—
OTIS Mock AIME 2024-2025100%—
ProofBench100%—
FrontierMath Erdős2.9%—

Knowledge Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 66.0 (#12), Muse Glimmer: 38.5 (#143)

Knowledge benchmarks
BenchmarkClaude Sonnet 5.5Muse Glimmer
LMArena Expert15401386
GPQA Diamond95.6%—
SimpleQA Verified46.5%—

Multimodal Not comparable

Claude Sonnet 5.5: 51.5 (#6), Muse Glimmer: —

Multimodal benchmarks
BenchmarkClaude Sonnet 5.5Muse Glimmer
LMArena Vision1289—
Furniture Assembly75%—

Multilingual Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 55.3 (#30), Muse Glimmer: 50.5 (#122)

Multilingual benchmarks
BenchmarkClaude Sonnet 5.5Muse Glimmer
LMArena Non-English14521384
LMArena Chinese15221412
LMArena Russian14511390

Instruction Following Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 78.3 (#11), Muse Glimmer: 72.6 (#135)

Instruction Following benchmarks
BenchmarkClaude Sonnet 5.5Muse Glimmer
LMArena Instruction Following14951375

Long Context Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 45.9 (#28), Muse Glimmer: 42.1 (#129)

Long Context benchmarks
BenchmarkClaude Sonnet 5.5Muse Glimmer
LMArena Longer Query14981382

Writing & Preference Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 66.0 (#40), Muse Glimmer: 57.5 (#126)

Writing & Preference benchmarks
BenchmarkClaude Sonnet 5.5Muse Glimmer
LMArena Text14711389
LMArena Creative Writing14651339
LMArena Multi-Turn14741399

Frequently asked questions

Is Claude Sonnet 5.5 better than Muse Glimmer?

Claude Sonnet 5.5 is the stronger model overall, scoring 61.9 to 41.7 on the Noometry Index.

Is Claude Sonnet 5.5 or Muse Glimmer better for coding?

Claude Sonnet 5.5 scores higher on coding benchmarks: 67.3 versus 40.4 in the Noometry coding category.

How many benchmarks do Claude Sonnet 5.5 and Muse Glimmer share?

15 benchmarks have published results for both models. Claude Sonnet 5.5 has 32 scored results on Noometry and Muse Glimmer has 15.

Related comparisons

Go deeper