Model comparison

Muse Spark 1.1 vs Qwen2.5 Plus 1127

Muse Spark 1.1 is the stronger model overall, scoring 49.9 to 38.8 on the Noometry Index.

Last verified . 14 shared benchmarks.

Muse Spark 1.1 Meta

49.9

Rank #51 Confirmed

Qwen2.5 Plus 1127 Alibaba (Qwen)

38.8

Rank #181 Confirmed

Summary

  • They share 14 benchmarks with published results for both. Muse Spark 1.1 scores higher in 8 categories and Qwen2.5 Plus 1127 in 0 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Muse Spark 1.1 leads 73.4 to 49.4.

Side by side

Muse Spark 1.1 and Qwen2.5 Plus 1127 specifications
Muse Spark 1.1Qwen2.5 Plus 1127
ProviderMetaAlibaba (Qwen)
Noometry Index49.938.8
Released2026-04-08—
WeightsProprietaryProprietary
Context window1.05M—
Max output131K—
Input $ / M tokens$1.25—
Output $ / M tokens$4.25—
Results tracked3714

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Spark 1.1 leads

Muse Spark 1.1: 51.3 (#40), Qwen2.5 Plus 1127: 38.5 (#175)

Coding benchmarks
BenchmarkMuse Spark 1.1Qwen2.5 Plus 1127
LMArena Coding14981314
DeepSWE53.3%—
LMArena WebDev1542—
SciCode58.8%—

Agentic & Tool Use Not comparable

Muse Spark 1.1: 30.8 (#73), Qwen2.5 Plus 1127: —

Agentic & Tool Use benchmarks
BenchmarkMuse Spark 1.1Qwen2.5 Plus 1127
APEX-Agents31.8%—
τ²-bench Banking40.5%—
GBAEval7.9%—
GDP.pdf15%—
Vending-Bench 26,520—

Reasoning Muse Spark 1.1 leads

Muse Spark 1.1: 47.1 (#44), Qwen2.5 Plus 1127: 25.9 (#141)

Reasoning benchmarks
BenchmarkMuse Spark 1.1Qwen2.5 Plus 1127
LMArena Hard Prompts14861299
NYT Connections (extended)84.9%—
CritPt15.1%—
DTBench94.4%—
LMCA49.9%—
Surface Evolver Bench52.5%—
Epoch Capabilities Index154.21—

Math Muse Spark 1.1 leads

Muse Spark 1.1: 45.5 (#76), Qwen2.5 Plus 1127: 36.1 (#174)

Math benchmarks
BenchmarkMuse Spark 1.1Qwen2.5 Plus 1127
LMArena Math14831298
ProofBench39%—

Knowledge Muse Spark 1.1 leads

Muse Spark 1.1: 53.1 (#59), Qwen2.5 Plus 1127: 35.5 (#183)

Knowledge benchmarks
BenchmarkMuse Spark 1.1Qwen2.5 Plus 1127
LMArena Expert14781289
SimpleQA Verified57.8%—

Multimodal Not comparable

Muse Spark 1.1: 42.6 (#29), Qwen2.5 Plus 1127: —

Multimodal benchmarks
BenchmarkMuse Spark 1.1Qwen2.5 Plus 1127
LMArena Vision1293—
LMArena Document1465—

Multilingual Muse Spark 1.1 leads

Muse Spark 1.1: 56.7 (#17), Qwen2.5 Plus 1127: 41.9 (#201)

Multilingual benchmarks
BenchmarkMuse Spark 1.1Qwen2.5 Plus 1127
LMArena Non-English14721265
LMArena Chinese15181314
LMArena German14661231
LMArena Japanese14511207
LMArena Russian14831271
LMArena French1494—
LMArena Korean1458—
LMArena Spanish1464—

Instruction Following Muse Spark 1.1 leads

Muse Spark 1.1: 76.5 (#39), Qwen2.5 Plus 1127: 67.2 (#199)

Instruction Following benchmarks
BenchmarkMuse Spark 1.1Qwen2.5 Plus 1127
LMArena Instruction Following14571275

Long Context Muse Spark 1.1 leads

Muse Spark 1.1: 44.8 (#58), Qwen2.5 Plus 1127: 39.2 (#184)

Long Context benchmarks
BenchmarkMuse Spark 1.1Qwen2.5 Plus 1127
LMArena Longer Query14621292

Writing & Preference Muse Spark 1.1 leads

Muse Spark 1.1: 73.4 (#11), Qwen2.5 Plus 1127: 49.4 (#192)

Writing & Preference benchmarks
BenchmarkMuse Spark 1.1Qwen2.5 Plus 1127
LMArena Text14791299
LMArena Creative Writing14371262
LMArena Multi-Turn14851299
EQ-Bench Creative Writing1927—
EQ-Bench 41260—

Frequently asked questions

Is Muse Spark 1.1 better than Qwen2.5 Plus 1127?

Muse Spark 1.1 is the stronger model overall, scoring 49.9 to 38.8 on the Noometry Index.

Is Muse Spark 1.1 or Qwen2.5 Plus 1127 better for coding?

Muse Spark 1.1 scores higher on coding benchmarks: 51.3 versus 38.5 in the Noometry coding category.

How many benchmarks do Muse Spark 1.1 and Qwen2.5 Plus 1127 share?

14 benchmarks have published results for both models. Muse Spark 1.1 has 37 scored results on Noometry and Qwen2.5 Plus 1127 has 14.

Related comparisons

Go deeper