Model comparison

Muse Spark vs Qwen3.7 Plus

Muse Spark is the stronger model overall, scoring 50.6 to 45.3 on the Noometry Index.

Last verified . 23 shared benchmarks.

Muse Spark Meta

50.6

Rank #46 Confirmed

Qwen3.7 Plus Alibaba (Qwen)

45.3

Rank #72 Confirmed

Summary

  • They share 23 benchmarks with published results for both. Muse Spark scores higher in 6 categories and Qwen3.7 Plus in 3 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Muse Spark leads 65.7 to 54.9.
  • The biggest single-benchmark swing is SciCode: 51.5% for Muse Spark and 45.5% for Qwen3.7 Plus.

Side by side

Muse Spark and Qwen3.7 Plus specifications
Muse SparkQwen3.7 Plus
ProviderMetaAlibaba (Qwen)
Noometry Index50.645.3
Released2026-04-082026-06-02
WeightsProprietaryProprietary
Context window—1M
Max output—131K
Input $ / M tokens—$0.40
Output $ / M tokens—$1.60
Results tracked2732

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Spark leads

Muse Spark: 46.2 (#69), Qwen3.7 Plus: 36.6 (#206)

Coding benchmarks
BenchmarkMuse SparkQwen3.7 Plus
SciCode51.5%45.5%
LMArena Coding14811473
FrontierCode—10.2%

Agentic & Tool Use Not comparable

Muse Spark: —, Qwen3.7 Plus: 21.4 (#138)

Agentic & Tool Use benchmarks
BenchmarkMuse SparkQwen3.7 Plus
OSWorld 2.0—2.8%

Reasoning Qwen3.7 Plus leads

Muse Spark: 35.9 (#67), Qwen3.7 Plus: 39.3 (#59)

Reasoning benchmarks
BenchmarkMuse SparkQwen3.7 Plus
CritPt11.3%9.1%
LMArena Hard Prompts14741460
Epoch Capabilities Index152.04147.37
NYT Connections (extended)—74.8%
Chess Puzzles—24%
Mystery Game Puzzles—17%
DTBench—84%
LMCA—37.6%

Math Qwen3.7 Plus leads

Muse Spark: 47.8 (#66), Qwen3.7 Plus: 50.5 (#56)

Math benchmarks
BenchmarkMuse SparkQwen3.7 Plus
OTIS Mock AIME 2024-202588.9%93.3%
LMArena Math14551466
FrontierMath (Tiers 1-3)—34.4%
ProofBench17%—
FrontierMath (Feb 2025 set)39%—
FrontierMath Tier 4 (v1)14.6%—

Knowledge Muse Spark leads

Muse Spark: 65.7 (#13), Qwen3.7 Plus: 54.9 (#51)

Knowledge benchmarks
BenchmarkMuse SparkQwen3.7 Plus
GPQA Diamond89.8%87.9%
LMArena Expert14571467
Humanity's Last Exam40.6%—

Multimodal Muse Spark leads

Muse Spark: 43.4 (#24), Qwen3.7 Plus: 41.8 (#33)

Multimodal benchmarks
BenchmarkMuse SparkQwen3.7 Plus
LMArena Vision13061279
LMArena Document14441444

Multilingual Muse Spark leads

Muse Spark: 56.1 (#24), Qwen3.7 Plus: 54.8 (#38)

Multilingual benchmarks
BenchmarkMuse SparkQwen3.7 Plus
LMArena Non-English14641445
LMArena Chinese15091510
LMArena French14971473
LMArena German14971471
LMArena Korean14591415
LMArena Russian14661457
LMArena Spanish14721457
LMArena Japanese—1413

Instruction Following Too close to call

Muse Spark: 75.9 (#51), Qwen3.7 Plus: 75.8 (#52)

Instruction Following benchmarks
BenchmarkMuse SparkQwen3.7 Plus
LMArena Instruction Following14421440

Long Context Too close to call

Muse Spark: 44.4 (#69), Qwen3.7 Plus: 44.5 (#65)

Long Context benchmarks
BenchmarkMuse SparkQwen3.7 Plus
LMArena Longer Query14511455

Writing & Preference Muse Spark leads

Muse Spark: 66.0 (#39), Qwen3.7 Plus: 64.3 (#56)

Writing & Preference benchmarks
BenchmarkMuse SparkQwen3.7 Plus
LMArena Text14741455
LMArena Creative Writing14591439
LMArena Multi-Turn14771460

Frequently asked questions

Is Muse Spark better than Qwen3.7 Plus?

Muse Spark is the stronger model overall, scoring 50.6 to 45.3 on the Noometry Index.

Is Muse Spark or Qwen3.7 Plus better for coding?

Muse Spark scores higher on coding benchmarks: 46.2 versus 36.6 in the Noometry coding category.

How many benchmarks do Muse Spark and Qwen3.7 Plus share?

23 benchmarks have published results for both models. Muse Spark has 27 scored results on Noometry and Qwen3.7 Plus has 32.

Related comparisons

Go deeper