Model comparison

Gemini 4 Argon vs Muse Spark 1.1

Gemini 4 Argon is the stronger model overall, scoring 56.5 to 49.9 on the Noometry Index.

Last verified . 19 shared benchmarks.

Gemini 4 Argon Google

56.5

Rank #24 Confirmed

Muse Spark 1.1 Meta

49.9

Rank #51 Confirmed

Summary

  • They share 19 benchmarks with published results for both. Gemini 4 Argon scores higher in 7 categories and Muse Spark 1.1 in 3 categories; 10 gaps are clear of the uncertainty.
  • The widest gap is in math, where Gemini 4 Argon leads 73.9 to 45.5.
  • The biggest single-benchmark swing is ProofBench: 99% for Gemini 4 Argon and 39% for Muse Spark 1.1.

Side by side

Gemini 4 Argon and Muse Spark 1.1 specifications
Gemini 4 ArgonMuse Spark 1.1
ProviderGoogleMeta
Noometry Index56.549.9
Released2026-09-302026-04-08
WeightsProprietaryProprietary
Context window—1.05M
Max output—131K
Input $ / M tokens—$1.25
Output $ / M tokens—$4.25
Results tracked2137

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemini 4 Argon leads

Gemini 4 Argon: 62.0 (#9), Muse Spark 1.1: 51.3 (#40)

Coding benchmarks
BenchmarkGemini 4 ArgonMuse Spark 1.1
LMArena WebDev16781542
SciCode61.8%58.8%
LMArena Coding15501498
DeepSWE—53.3%
FrontierSWE55%—

Agentic & Tool Use Gemini 4 Argon leads

Gemini 4 Argon: 49.2 (#8), Muse Spark 1.1: 30.8 (#73)

Agentic & Tool Use benchmarks
BenchmarkGemini 4 ArgonMuse Spark 1.1
APEX-Agents82.2%31.8%
Vending-Bench 213,7186,520
τ²-bench Banking—40.5%
GBAEval—7.9%
GDP.pdf—15%

Reasoning Muse Spark 1.1 leads

Gemini 4 Argon: 44.2 (#47), Muse Spark 1.1: 47.1 (#44)

Reasoning benchmarks
BenchmarkGemini 4 ArgonMuse Spark 1.1
CritPt27.1%15.1%
LMArena Hard Prompts15481486
NYT Connections (extended)—84.9%
DTBench—94.4%
LMCA—49.9%
Surface Evolver Bench—52.5%
Epoch Capabilities Index—154.21

Math Gemini 4 Argon leads

Gemini 4 Argon: 73.9 (#17), Muse Spark 1.1: 45.5 (#76)

Math benchmarks
BenchmarkGemini 4 ArgonMuse Spark 1.1
ProofBench99%39%
LMArena Math15361483

Knowledge Muse Spark 1.1 leads

Gemini 4 Argon: 43.9 (#89), Muse Spark 1.1: 53.1 (#59)

Knowledge benchmarks
BenchmarkGemini 4 ArgonMuse Spark 1.1
LMArena Expert15531478
SimpleQA Verified—57.8%

Multimodal Gemini 4 Argon leads

Gemini 4 Argon: 46.5 (#14), Muse Spark 1.1: 42.6 (#29)

Multimodal benchmarks
BenchmarkGemini 4 ArgonMuse Spark 1.1
LMArena Vision—1293
Blueprint-Bench 254.4%—
LMArena Document—1465

Multilingual Gemini 4 Argon leads

Gemini 4 Argon: 60.3 (#1), Muse Spark 1.1: 56.7 (#17)

Multilingual benchmarks
BenchmarkGemini 4 ArgonMuse Spark 1.1
LMArena Non-English15231472
LMArena Chinese16101518
LMArena Russian15371483
LMArena Spanish14971464
LMArena French—1494
LMArena German—1466
LMArena Japanese—1451
LMArena Korean—1458

Instruction Following Gemini 4 Argon leads

Gemini 4 Argon: 80.1 (#2), Muse Spark 1.1: 76.5 (#39)

Instruction Following benchmarks
BenchmarkGemini 4 ArgonMuse Spark 1.1
LMArena Instruction Following15381457

Long Context Gemini 4 Argon leads

Gemini 4 Argon: 47.6 (#15), Muse Spark 1.1: 44.8 (#58)

Long Context benchmarks
BenchmarkGemini 4 ArgonMuse Spark 1.1
LMArena Longer Query15491462

Writing & Preference Muse Spark 1.1 leads

Gemini 4 Argon: 71.4 (#19), Muse Spark 1.1: 73.4 (#11)

Writing & Preference benchmarks
BenchmarkGemini 4 ArgonMuse Spark 1.1
LMArena Text15341479
LMArena Creative Writing15311437
LMArena Multi-Turn15571485
EQ-Bench Creative Writing—1927
EQ-Bench 4—1260

Frequently asked questions

Is Gemini 4 Argon better than Muse Spark 1.1?

Gemini 4 Argon is the stronger model overall, scoring 56.5 to 49.9 on the Noometry Index.

Is Gemini 4 Argon or Muse Spark 1.1 better for coding?

Gemini 4 Argon scores higher on coding benchmarks: 62.0 versus 51.3 in the Noometry coding category.

How many benchmarks do Gemini 4 Argon and Muse Spark 1.1 share?

19 benchmarks have published results for both models. Gemini 4 Argon has 21 scored results on Noometry and Muse Spark 1.1 has 37.

Related comparisons

Go deeper