Model comparison

DeepSeek-V3.1-Terminus vs Muse Glimmer

DeepSeek-V3.1-Terminus is the stronger model overall, scoring 43.1 to 41.7 on the Noometry Index.

Last verified . 12 shared benchmarks.

DeepSeek-V3.1-Terminus DeepSeek

43.1

Rank #97 Confirmed

Muse Glimmer Meta

41.7

Rank #131 Confirmed

Summary

  • They share 12 benchmarks with published results for both. DeepSeek-V3.1-Terminus scores higher in 6 categories and Muse Glimmer in 1 category; 5 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where DeepSeek-V3.1-Terminus leads 61.0 to 57.5.

Side by side

DeepSeek-V3.1-Terminus and Muse Glimmer specifications
DeepSeek-V3.1-TerminusMuse Glimmer
ProviderDeepSeekMeta
Noometry Index43.141.7
Released2025-09-222026-08-10
WeightsOpenOpen
Context window164K—
Max output147K—
Input $ / M tokens$0.27—
Output $ / M tokens$1—
Results tracked1615

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding DeepSeek-V3.1-Terminus leads

DeepSeek-V3.1-Terminus: 42.0 (#113), Muse Glimmer: 40.4 (#142)

Coding benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Glimmer
SciCode40.6%44.9%
LMArena Coding14261416
LMArena WebDev—1355
ALE-Bench745.17—

Reasoning Too close to call

DeepSeek-V3.1-Terminus: 26.4 (#133), Muse Glimmer: 25.7 (#144)

Reasoning benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Glimmer
CritPt1.7%2.6%
LMArena Hard Prompts14261396
Kagi LLM Benchmark57.4%—
DTBench81.3%—
LMCA28.6%—

Math Too close to call

DeepSeek-V3.1-Terminus: 38.5 (#137), Muse Glimmer: 38.8 (#125)

Math benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Glimmer
LMArena Math14021417

Knowledge Not comparable

DeepSeek-V3.1-Terminus: —, Muse Glimmer: 38.5 (#143)

Knowledge benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Glimmer
LMArena Expert—1386

Multilingual DeepSeek-V3.1-Terminus leads

DeepSeek-V3.1-Terminus: 52.1 (#92), Muse Glimmer: 50.5 (#122)

Multilingual benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Glimmer
LMArena Non-English14071384
LMArena Russian14361390
LMArena Chinese—1412

Instruction Following DeepSeek-V3.1-Terminus leads

DeepSeek-V3.1-Terminus: 74.0 (#106), Muse Glimmer: 72.6 (#135)

Instruction Following benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Glimmer
LMArena Instruction Following14041375

Long Context DeepSeek-V3.1-Terminus leads

DeepSeek-V3.1-Terminus: 43.4 (#97), Muse Glimmer: 42.1 (#129)

Long Context benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Glimmer
LMArena Longer Query14211382

Writing & Preference DeepSeek-V3.1-Terminus leads

DeepSeek-V3.1-Terminus: 61.0 (#92), Muse Glimmer: 57.5 (#126)

Writing & Preference benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Glimmer
LMArena Text14191389
LMArena Creative Writing14031339
LMArena Multi-Turn14111399

Frequently asked questions

Is DeepSeek-V3.1-Terminus better than Muse Glimmer?

DeepSeek-V3.1-Terminus is the stronger model overall, scoring 43.1 to 41.7 on the Noometry Index.

Is DeepSeek-V3.1-Terminus or Muse Glimmer better for coding?

DeepSeek-V3.1-Terminus scores higher on coding benchmarks: 42.0 versus 40.4 in the Noometry coding category.

How many benchmarks do DeepSeek-V3.1-Terminus and Muse Glimmer share?

12 benchmarks have published results for both models. DeepSeek-V3.1-Terminus has 16 scored results on Noometry and Muse Glimmer has 15.

Related comparisons

Go deeper