Model comparison

Muse Glimmer vs Trinity Large Thinking

Muse Glimmer is the stronger model overall, scoring 41.7 to 38.6 on the Noometry Index.

Last verified . 15 shared benchmarks.

Muse Glimmer Meta

41.7

Rank #131 Confirmed

Trinity Large Thinking Arcee AI

38.6

Rank #185 Confirmed

Summary

  • They share 15 benchmarks with published results for both. Muse Glimmer scores higher in 7 categories and Trinity Large Thinking in 1 category; 7 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Muse Glimmer leads 25.7 to 16.9.
  • The biggest single-benchmark swing is SciCode: 44.9% for Muse Glimmer and 36.1% for Trinity Large Thinking.

Side by side

Muse Glimmer and Trinity Large Thinking specifications
Muse GlimmerTrinity Large Thinking
ProviderMetaArcee AI
Noometry Index41.738.6
Released2026-08-102026-04-01
WeightsOpenOpen
Context window—262K
Max output—80K
Input $ / M tokens—$0.25
Output $ / M tokens—$0.80
Results tracked1524

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Glimmer leads

Muse Glimmer: 40.4 (#142), Trinity Large Thinking: 34.1 (#244)

Coding benchmarks
BenchmarkMuse GlimmerTrinity Large Thinking
LMArena WebDev13551238
SciCode44.9%36.1%
LMArena Coding14161381

Reasoning Muse Glimmer leads

Muse Glimmer: 25.7 (#144), Trinity Large Thinking: 16.9 (#298)

Reasoning benchmarks
BenchmarkMuse GlimmerTrinity Large Thinking
CritPt2.6%0.9%
LMArena Hard Prompts13961350
NYT Connections (extended)—16.5%
Thematic Generalization—41.6%
Surface Evolver Bench—15.6%

Math Muse Glimmer leads

Muse Glimmer: 38.8 (#125), Trinity Large Thinking: 37.6 (#149)

Math benchmarks
BenchmarkMuse GlimmerTrinity Large Thinking
LMArena Math14171366

Knowledge Trinity Large Thinking leads

Muse Glimmer: 38.5 (#143), Trinity Large Thinking: 40.9 (#113)

Knowledge benchmarks
BenchmarkMuse GlimmerTrinity Large Thinking
LMArena Expert13861360
Vectara Hallucination Rate—6.9%

Multilingual Muse Glimmer leads

Muse Glimmer: 50.5 (#122), Trinity Large Thinking: 46.2 (#160)

Multilingual benchmarks
BenchmarkMuse GlimmerTrinity Large Thinking
LMArena Non-English13841325
LMArena Chinese14121373
LMArena Russian13901337
LMArena French—1374
LMArena German—1356
LMArena Japanese—1311
LMArena Korean—1306
LMArena Spanish—1357

Instruction Following Muse Glimmer leads

Muse Glimmer: 72.6 (#135), Trinity Large Thinking: 70.5 (#162)

Instruction Following benchmarks
BenchmarkMuse GlimmerTrinity Large Thinking
LMArena Instruction Following13751334

Long Context Too close to call

Muse Glimmer: 42.1 (#129), Trinity Large Thinking: 41.3 (#144)

Long Context benchmarks
BenchmarkMuse GlimmerTrinity Large Thinking
LMArena Longer Query13821355

Writing & Preference Muse Glimmer leads

Muse Glimmer: 57.5 (#126), Trinity Large Thinking: 53.8 (#158)

Writing & Preference benchmarks
BenchmarkMuse GlimmerTrinity Large Thinking
LMArena Text13891340
LMArena Creative Writing13391320
LMArena Multi-Turn13991342

Frequently asked questions

Is Muse Glimmer better than Trinity Large Thinking?

Muse Glimmer is the stronger model overall, scoring 41.7 to 38.6 on the Noometry Index.

Is Muse Glimmer or Trinity Large Thinking better for coding?

Muse Glimmer scores higher on coding benchmarks: 40.4 versus 34.1 in the Noometry coding category.

How many benchmarks do Muse Glimmer and Trinity Large Thinking share?

15 benchmarks have published results for both models. Muse Glimmer has 15 scored results on Noometry and Trinity Large Thinking has 24.

Related comparisons

Go deeper