Model comparison

DeepSeek-V3.1-Terminus vs Muse Spark

Muse Spark is the stronger model overall, scoring 50.6 to 43.1 on the Noometry Index.

Last verified . 12 shared benchmarks.

DeepSeek-V3.1-Terminus DeepSeek

43.1

Rank #97 Confirmed

Muse Spark Meta

50.6

Rank #46 Confirmed

Summary

  • They share 12 benchmarks with published results for both. DeepSeek-V3.1-Terminus scores higher in 0 categories and Muse Spark in 7 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Muse Spark leads 35.9 to 26.4.
  • The biggest single-benchmark swing is SciCode: 40.6% for DeepSeek-V3.1-Terminus and 51.5% for Muse Spark.
  • DeepSeek-V3.1-Terminus has downloadable open weights; the other is API-only.

Side by side

DeepSeek-V3.1-Terminus and Muse Spark specifications
DeepSeek-V3.1-TerminusMuse Spark
ProviderDeepSeekMeta
Noometry Index43.150.6
Released2025-09-222026-04-08
WeightsOpenProprietary
Context window164K—
Max output147K—
Input $ / M tokens$0.27—
Output $ / M tokens$1—
Results tracked1627

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Spark leads

DeepSeek-V3.1-Terminus: 42.0 (#113), Muse Spark: 46.2 (#69)

Coding benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Spark
SciCode40.6%51.5%
LMArena Coding14261481
ALE-Bench745.17—

Reasoning Muse Spark leads

DeepSeek-V3.1-Terminus: 26.4 (#133), Muse Spark: 35.9 (#67)

Reasoning benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Spark
CritPt1.7%11.3%
LMArena Hard Prompts14261474
Kagi LLM Benchmark57.4%—
DTBench81.3%—
LMCA28.6%—
Epoch Capabilities Index—152.04

Math Muse Spark leads

DeepSeek-V3.1-Terminus: 38.5 (#137), Muse Spark: 47.8 (#66)

Math benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Spark
LMArena Math14021455
OTIS Mock AIME 2024-2025—88.9%
ProofBench—17%
FrontierMath (Feb 2025 set)—39%
FrontierMath Tier 4 (v1)—14.6%

Knowledge Not comparable

DeepSeek-V3.1-Terminus: —, Muse Spark: 65.7 (#13)

Knowledge benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Spark
GPQA Diamond—89.8%
Humanity's Last Exam—40.6%
LMArena Expert—1457

Multimodal Not comparable

DeepSeek-V3.1-Terminus: —, Muse Spark: 43.4 (#24)

Multimodal benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Spark
LMArena Vision—1306
LMArena Document—1444

Multilingual Muse Spark leads

DeepSeek-V3.1-Terminus: 52.1 (#92), Muse Spark: 56.1 (#24)

Multilingual benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Spark
LMArena Non-English14071464
LMArena Russian14361466
LMArena Chinese—1509
LMArena French—1497
LMArena German—1497
LMArena Korean—1459
LMArena Spanish—1472

Instruction Following Muse Spark leads

DeepSeek-V3.1-Terminus: 74.0 (#106), Muse Spark: 75.9 (#51)

Instruction Following benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Spark
LMArena Instruction Following14041442

Long Context Too close to call

DeepSeek-V3.1-Terminus: 43.4 (#97), Muse Spark: 44.4 (#69)

Long Context benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Spark
LMArena Longer Query14211451

Writing & Preference Muse Spark leads

DeepSeek-V3.1-Terminus: 61.0 (#92), Muse Spark: 66.0 (#39)

Writing & Preference benchmarks
BenchmarkDeepSeek-V3.1-TerminusMuse Spark
LMArena Text14191474
LMArena Creative Writing14031459
LMArena Multi-Turn14111477

Frequently asked questions

Is DeepSeek-V3.1-Terminus better than Muse Spark?

Muse Spark is the stronger model overall, scoring 50.6 to 43.1 on the Noometry Index.

Is DeepSeek-V3.1-Terminus or Muse Spark better for coding?

Muse Spark scores higher on coding benchmarks: 46.2 versus 42.0 in the Noometry coding category.

How many benchmarks do DeepSeek-V3.1-Terminus and Muse Spark share?

12 benchmarks have published results for both models. DeepSeek-V3.1-Terminus has 16 scored results on Noometry and Muse Spark has 27.

Related comparisons

Go deeper