Model comparison

Muse Spark vs Qwen Max

Muse Spark is the stronger model overall, scoring 50.6 to 34.7 on the Noometry Index.

Last verified . 19 shared benchmarks.

Muse Spark Meta

50.6

Rank #46 Confirmed

Qwen Max Alibaba (Qwen)

34.7

Rank #230 Confirmed

Summary

  • They share 19 benchmarks with published results for both. Muse Spark scores higher in 8 categories and Qwen Max in 0 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Muse Spark leads 65.7 to 30.3.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 88.9% for Muse Spark and 16.1% for Qwen Max.

Side by side

Muse Spark and Qwen Max specifications
Muse SparkQwen Max
ProviderMetaAlibaba (Qwen)
Noometry Index50.634.7
Released2026-04-082024-04-03
WeightsProprietaryProprietary
Context window—33K
Max output—8K
Input $ / M tokens—$1.60
Output $ / M tokens—$6.40
Results tracked2723

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Spark leads

Muse Spark: 46.2 (#69), Qwen Max: 30.7 (#292)

Coding benchmarks
BenchmarkMuse SparkQwen Max
LMArena Coding14811288
Aider Polyglot—21.8%
SciCode51.5%—

Reasoning Muse Spark leads

Muse Spark: 35.9 (#67), Qwen Max: 25.1 (#151)

Reasoning benchmarks
BenchmarkMuse SparkQwen Max
LMArena Hard Prompts14741269
CritPt11.3%—
Epoch Capabilities Index152.04—

Math Muse Spark leads

Muse Spark: 47.8 (#66), Qwen Max: 22.3 (#276)

Math benchmarks
BenchmarkMuse SparkQwen Max
OTIS Mock AIME 2024-202588.9%16.1%
LMArena Math14551275
FrontierMath (Feb 2025 set)39%1%
ProofBench17%—
MATH Level 5—67.2%
FrontierMath Tier 4 (v1)14.6%—

Knowledge Muse Spark leads

Muse Spark: 65.7 (#13), Qwen Max: 30.3 (#228)

Knowledge benchmarks
BenchmarkMuse SparkQwen Max
GPQA Diamond89.8%56.1%
LMArena Expert14571248
Humanity's Last Exam40.6%—

Multimodal Not comparable

Muse Spark: 43.4 (#24), Qwen Max: —

Multimodal benchmarks
BenchmarkMuse SparkQwen Max
LMArena Vision1306—
LMArena Document1444—

Multilingual Muse Spark leads

Muse Spark: 56.1 (#24), Qwen Max: 41.8 (#202)

Multilingual benchmarks
BenchmarkMuse SparkQwen Max
LMArena Non-English14641263
LMArena Chinese15091254
LMArena French14971330
LMArena German14971254
LMArena Korean14591142
LMArena Russian14661274
LMArena Spanish14721290
LMArena Japanese—1205

Instruction Following Muse Spark leads

Muse Spark: 75.9 (#51), Qwen Max: 66.5 (#208)

Instruction Following benchmarks
BenchmarkMuse SparkQwen Max
LMArena Instruction Following14421262

Long Context Muse Spark leads

Muse Spark: 44.4 (#69), Qwen Max: 39.4 (#180)

Long Context benchmarks
BenchmarkMuse SparkQwen Max
LMArena Longer Query14511288
Fiction.LiveBench—66.7%

Writing & Preference Muse Spark leads

Muse Spark: 66.0 (#39), Qwen Max: 47.8 (#205)

Writing & Preference benchmarks
BenchmarkMuse SparkQwen Max
LMArena Text14741282
LMArena Creative Writing14591248
LMArena Multi-Turn14771277

Frequently asked questions

Is Muse Spark better than Qwen Max?

Muse Spark is the stronger model overall, scoring 50.6 to 34.7 on the Noometry Index.

Is Muse Spark or Qwen Max better for coding?

Muse Spark scores higher on coding benchmarks: 46.2 versus 30.7 in the Noometry coding category.

How many benchmarks do Muse Spark and Qwen Max share?

19 benchmarks have published results for both models. Muse Spark has 27 scored results on Noometry and Qwen Max has 23.

Related comparisons

Go deeper