Model comparison

Muse Spark 1.1 vs Qwen Max

Muse Spark 1.1 is the stronger model overall, scoring 49.9 to 34.7 on the Noometry Index.

Last verified . 17 shared benchmarks.

Muse Spark 1.1 Meta

49.9

Rank #51 Confirmed

Qwen Max Alibaba (Qwen)

34.7

Rank #230 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Muse Spark 1.1 scores higher in 8 categories and Qwen Max in 0 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Muse Spark 1.1 leads 73.4 to 47.8.
  • Muse Spark 1.1 is cheaper at $1.25 / $4.25 per million input/output tokens, against $1.60 / $6.40 for Qwen Max.
  • Muse Spark 1.1 accepts more context: 1.05M tokens versus 33K.

Side by side

Muse Spark 1.1 and Qwen Max specifications
Muse Spark 1.1Qwen Max
ProviderMetaAlibaba (Qwen)
Noometry Index49.934.7
Released2026-04-082024-04-03
WeightsProprietaryProprietary
Context window1.05M33K
Max output131K8K
Input $ / M tokens$1.25$1.60
Output $ / M tokens$4.25$6.40
Results tracked3723

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Spark 1.1 leads

Muse Spark 1.1: 51.3 (#40), Qwen Max: 30.7 (#292)

Coding benchmarks
BenchmarkMuse Spark 1.1Qwen Max
LMArena Coding14981288
DeepSWE53.3%—
Aider Polyglot—21.8%
LMArena WebDev1542—
SciCode58.8%—

Agentic & Tool Use Not comparable

Muse Spark 1.1: 30.8 (#73), Qwen Max: —

Agentic & Tool Use benchmarks
BenchmarkMuse Spark 1.1Qwen Max
APEX-Agents31.8%—
τ²-bench Banking40.5%—
GBAEval7.9%—
GDP.pdf15%—
Vending-Bench 26,520—

Reasoning Muse Spark 1.1 leads

Muse Spark 1.1: 47.1 (#44), Qwen Max: 25.1 (#151)

Reasoning benchmarks
BenchmarkMuse Spark 1.1Qwen Max
LMArena Hard Prompts14861269
NYT Connections (extended)84.9%—
CritPt15.1%—
DTBench94.4%—
LMCA49.9%—
Surface Evolver Bench52.5%—
Epoch Capabilities Index154.21—

Math Muse Spark 1.1 leads

Muse Spark 1.1: 45.5 (#76), Qwen Max: 22.3 (#276)

Math benchmarks
BenchmarkMuse Spark 1.1Qwen Max
LMArena Math14831275
OTIS Mock AIME 2024-2025—16.1%
ProofBench39%—
MATH Level 5—67.2%
FrontierMath (Feb 2025 set)—1%

Knowledge Muse Spark 1.1 leads

Muse Spark 1.1: 53.1 (#59), Qwen Max: 30.3 (#228)

Knowledge benchmarks
BenchmarkMuse Spark 1.1Qwen Max
LMArena Expert14781248
GPQA Diamond—56.1%
SimpleQA Verified57.8%—

Multimodal Not comparable

Muse Spark 1.1: 42.6 (#29), Qwen Max: —

Multimodal benchmarks
BenchmarkMuse Spark 1.1Qwen Max
LMArena Vision1293—
LMArena Document1465—

Multilingual Muse Spark 1.1 leads

Muse Spark 1.1: 56.7 (#17), Qwen Max: 41.8 (#202)

Multilingual benchmarks
BenchmarkMuse Spark 1.1Qwen Max
LMArena Non-English14721263
LMArena Chinese15181254
LMArena French14941330
LMArena German14661254
LMArena Japanese14511205
LMArena Korean14581142
LMArena Russian14831274
LMArena Spanish14641290

Instruction Following Muse Spark 1.1 leads

Muse Spark 1.1: 76.5 (#39), Qwen Max: 66.5 (#208)

Instruction Following benchmarks
BenchmarkMuse Spark 1.1Qwen Max
LMArena Instruction Following14571262

Long Context Muse Spark 1.1 leads

Muse Spark 1.1: 44.8 (#58), Qwen Max: 39.4 (#180)

Long Context benchmarks
BenchmarkMuse Spark 1.1Qwen Max
LMArena Longer Query14621288
Fiction.LiveBench—66.7%

Writing & Preference Muse Spark 1.1 leads

Muse Spark 1.1: 73.4 (#11), Qwen Max: 47.8 (#205)

Writing & Preference benchmarks
BenchmarkMuse Spark 1.1Qwen Max
LMArena Text14791282
LMArena Creative Writing14371248
LMArena Multi-Turn14851277
EQ-Bench Creative Writing1927—
EQ-Bench 41260—

Frequently asked questions

Is Muse Spark 1.1 better than Qwen Max?

Muse Spark 1.1 is the stronger model overall, scoring 49.9 to 34.7 on the Noometry Index.

Which is cheaper, Muse Spark 1.1 or Qwen Max?

Muse Spark 1.1 is cheaper. It lists at $1.25 per million input tokens and $4.25 per million output tokens; Qwen Max lists at $1.60 and $6.40.

Is Muse Spark 1.1 or Qwen Max better for coding?

Muse Spark 1.1 scores higher on coding benchmarks: 51.3 versus 30.7 in the Noometry coding category.

Which has the bigger context window?

Muse Spark 1.1 does, with 1.05M tokens against 33K.

How many benchmarks do Muse Spark 1.1 and Qwen Max share?

17 benchmarks have published results for both models. Muse Spark 1.1 has 37 scored results on Noometry and Qwen Max has 23.

Related comparisons

Go deeper