Model comparison

Claude 3.5 Sonnet vs Muse Spark 1.2

Muse Spark 1.2 is the stronger model overall, scoring 50.3 to 34.6 on the Noometry Index.

Last verified . 20 shared benchmarks.

Claude 3.5 Sonnet Anthropic

34.6

Rank #231 Confirmed

Muse Spark 1.2 Meta

50.3

Rank #48 Confirmed

Summary

  • They share 20 benchmarks with published results for both. Claude 3.5 Sonnet scores higher in 1 category and Muse Spark 1.2 in 9 categories; 10 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Muse Spark 1.2 leads 51.3 to 23.1.
  • The biggest single-benchmark swing is SimpleBench: 41.4% for Claude 3.5 Sonnet and 74.5% for Muse Spark 1.2.

Side by side

Claude 3.5 Sonnet and Muse Spark 1.2 specifications
Claude 3.5 SonnetMuse Spark 1.2
ProviderAnthropicMeta
Noometry Index34.650.3
Released2024-06-202026-08-05
WeightsProprietaryProprietary
Context window—1.05M
Max output—131K
Input $ / M tokens—$1.25
Output $ / M tokens—$4.25
Results tracked6031

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Spark 1.2 leads

Claude 3.5 Sonnet: 39.0 (#165), Muse Spark 1.2: 49.2 (#51)

Coding benchmarks
BenchmarkClaude 3.5 SonnetMuse Spark 1.2
WeirdML40%60.3%
LMArena Coding13421495
DeepSWE—54.9%
Aider Polyglot51.6%—
LMArena WebDev—1533
FrontierSWE—12%
SciCode—56.4%
GSO4.6%—
BigCodeBench Instruct46.8%—
LiveBench Coding67.1%—
BigCodeBench Complete58.6%—
CadEval48%—
HumanEval+81.7%—
MBPP+74.3%—

Agentic & Tool Use Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 32.3 (#67), Muse Spark 1.2: 29.4 (#87)

Agentic & Tool Use benchmarks
BenchmarkClaude 3.5 SonnetMuse Spark 1.2
APEX-Agents—36.4%
TheAgentCompany24%—
Cybench17.5%—
BALROG32.6%—
GDP.pdf—16%
METR Time Horizons45.2%—

Reasoning Muse Spark 1.2 leads

Claude 3.5 Sonnet: 23.1 (#183), Muse Spark 1.2: 51.3 (#34)

Reasoning benchmarks
BenchmarkClaude 3.5 SonnetMuse Spark 1.2
SimpleBench41.4%74.5%
LMArena Hard Prompts13051486
DTBench67.8%94.7%
Epoch Capabilities Index133.55154.87
NYT Connections (extended)—79.2%
CritPt—17.7%
EnigmaEval0.9%—
LiveBench Reasoning56.7%—
LiveBench Data Analysis55%—
LMCA—48.4%
ForecastBench60.7—
LiveBench59%—

Math Muse Spark 1.2 leads

Claude 3.5 Sonnet: 19.2 (#288), Muse Spark 1.2: 46.4 (#70)

Math benchmarks
BenchmarkClaude 3.5 SonnetMuse Spark 1.2
LMArena Math13071471
OTIS Mock AIME 2024-20258.5%—
ProofBench—43%
Omni-MATH27.6%—
LiveBench Math52.3%—
MATH Level 556.9%—
FrontierMath (Feb 2025 set)2.1%—
FrontierMath Tier 4 (v1)0%—

Knowledge Muse Spark 1.2 leads

Claude 3.5 Sonnet: 28.6 (#245), Muse Spark 1.2: 54.1 (#53)

Knowledge benchmarks
BenchmarkClaude 3.5 SonnetMuse Spark 1.2
LMArena Expert12651480
GPQA Diamond55.3%—
Humanity's Last Exam4.1%—
SimpleQA Verified—60.3%
MMLU-Pro77.7%—
Confabulations19.9%—
GPQA (HELM)56.5%—
MMLU87.3%—

Multimodal Muse Spark 1.2 leads

Claude 3.5 Sonnet: 26.5 (#120), Muse Spark 1.2: 43.4 (#25)

Multimodal benchmarks
BenchmarkClaude 3.5 SonnetMuse Spark 1.2
LMArena Vision11251305
Video-MME60%—
GeoBench62%—
VPCT33%—

Multilingual Muse Spark 1.2 leads

Claude 3.5 Sonnet: 43.2 (#185), Muse Spark 1.2: 57.1 (#11)

Multilingual benchmarks
BenchmarkClaude 3.5 SonnetMuse Spark 1.2
LMArena Non-English12831478
LMArena Chinese12721511
LMArena French13051513
LMArena Russian13061487
LMArena Spanish12901498
LMArena German1297—
LMArena Japanese1234—
LMArena Korean1200—

Instruction Following Muse Spark 1.2 leads

Claude 3.5 Sonnet: 68.8 (#182), Muse Spark 1.2: 76.7 (#36)

Instruction Following benchmarks
BenchmarkClaude 3.5 SonnetMuse Spark 1.2
LMArena Instruction Following12971461
LiveBench Instruction Following69.3%—
IFEval85.5%—

Long Context Muse Spark 1.2 leads

Claude 3.5 Sonnet: 39.9 (#167), Muse Spark 1.2: 45.2 (#48)

Long Context benchmarks
BenchmarkClaude 3.5 SonnetMuse Spark 1.2
LMArena Longer Query13111475

Writing & Preference Muse Spark 1.2 leads

Claude 3.5 Sonnet: 52.9 (#164), Muse Spark 1.2: 72.3 (#14)

Writing & Preference benchmarks
BenchmarkClaude 3.5 SonnetMuse Spark 1.2
LMArena Text12981482
LMArena Creative Writing12921449
EQ-Bench Creative Writing14511840
LMArena Multi-Turn13261494
Short-Story Creative Writing80.3%—
WildBench79.2%—
LiveBench Language53.8%—

Frequently asked questions

Is Claude 3.5 Sonnet better than Muse Spark 1.2?

Muse Spark 1.2 is the stronger model overall, scoring 50.3 to 34.6 on the Noometry Index.

Is Claude 3.5 Sonnet or Muse Spark 1.2 better for coding?

Muse Spark 1.2 scores higher on coding benchmarks: 49.2 versus 39.0 in the Noometry coding category.

How many benchmarks do Claude 3.5 Sonnet and Muse Spark 1.2 share?

20 benchmarks have published results for both models. Claude 3.5 Sonnet has 60 scored results on Noometry and Muse Spark 1.2 has 31.

Related comparisons

Go deeper