Model comparison

Chatgpt 4o Latest 20250326 vs Muse Spark 1.2

Muse Spark 1.2 is the stronger model overall, scoring 50.3 to 43.8 on the Noometry Index.

Last verified . 16 shared benchmarks.

Chatgpt 4o Latest 20250326 OpenAI

43.8

Rank #82 Confirmed

Muse Spark 1.2 Meta

50.3

Rank #48 Confirmed

Summary

  • They share 16 benchmarks with published results for both. Chatgpt 4o Latest 20250326 scores higher in 0 categories and Muse Spark 1.2 in 9 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Muse Spark 1.2 leads 51.3 to 33.8.

Side by side

Chatgpt 4o Latest 20250326 and Muse Spark 1.2 specifications
Chatgpt 4o Latest 20250326Muse Spark 1.2
ProviderOpenAIMeta
Noometry Index43.850.3
Released—2026-08-05
WeightsProprietaryProprietary
Context window—1.05M
Max output—131K
Input $ / M tokens—$1.25
Output $ / M tokens—$4.25
Results tracked2131

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Spark 1.2 leads

Chatgpt 4o Latest 20250326: 41.6 (#122), Muse Spark 1.2: 49.2 (#51)

Coding benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.2
LMArena Coding14131495
DeepSWE—54.9%
LMArena WebDev—1533
FrontierSWE—12%
SciCode—56.4%
WeirdML—60.3%

Agentic & Tool Use Not comparable

Chatgpt 4o Latest 20250326: —, Muse Spark 1.2: 29.4 (#87)

Agentic & Tool Use benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.2
APEX-Agents—36.4%
GDP.pdf—16%

Reasoning Muse Spark 1.2 leads

Chatgpt 4o Latest 20250326: 33.8 (#71), Muse Spark 1.2: 51.3 (#34)

Reasoning benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.2
LMArena Hard Prompts14241486
SimpleBench—74.5%
Kagi LLM Benchmark75%—
NYT Connections (extended)—79.2%
CritPt—17.7%
DTBench—94.7%
LMCA—48.4%
Epoch Capabilities Index—154.87

Math Muse Spark 1.2 leads

Chatgpt 4o Latest 20250326: 38.6 (#134), Muse Spark 1.2: 46.4 (#70)

Math benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.2
LMArena Math14071471
ProofBench—43%

Knowledge Muse Spark 1.2 leads

Chatgpt 4o Latest 20250326: 39.2 (#137), Muse Spark 1.2: 54.1 (#53)

Knowledge benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.2
LMArena Expert14011480
SimpleQA Verified—60.3%
Confabulations16.6%—

Multimodal Muse Spark 1.2 leads

Chatgpt 4o Latest 20250326: 39.6 (#58), Muse Spark 1.2: 43.4 (#25)

Multimodal benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.2
LMArena Vision12431305

Multilingual Muse Spark 1.2 leads

Chatgpt 4o Latest 20250326: 52.9 (#76), Muse Spark 1.2: 57.1 (#11)

Multilingual benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.2
LMArena Non-English14191478
LMArena Chinese14571511
LMArena French14461513
LMArena Russian14291487
LMArena Spanish14341498
LMArena German1423—
LMArena Japanese1405—
LMArena Korean1396—

Instruction Following Muse Spark 1.2 leads

Chatgpt 4o Latest 20250326: 74.0 (#107), Muse Spark 1.2: 76.7 (#36)

Instruction Following benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.2
LMArena Instruction Following14031461

Long Context Muse Spark 1.2 leads

Chatgpt 4o Latest 20250326: 43.1 (#107), Muse Spark 1.2: 45.2 (#48)

Long Context benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.2
LMArena Longer Query14131475

Writing & Preference Muse Spark 1.2 leads

Chatgpt 4o Latest 20250326: 62.6 (#72), Muse Spark 1.2: 72.3 (#14)

Writing & Preference benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark 1.2
LMArena Text14291482
LMArena Creative Writing14051449
EQ-Bench Creative Writing15011840
LMArena Multi-Turn14541494

Frequently asked questions

Is Chatgpt 4o Latest 20250326 better than Muse Spark 1.2?

Muse Spark 1.2 is the stronger model overall, scoring 50.3 to 43.8 on the Noometry Index.

Is Chatgpt 4o Latest 20250326 or Muse Spark 1.2 better for coding?

Muse Spark 1.2 scores higher on coding benchmarks: 49.2 versus 41.6 in the Noometry coding category.

How many benchmarks do Chatgpt 4o Latest 20250326 and Muse Spark 1.2 share?

16 benchmarks have published results for both models. Chatgpt 4o Latest 20250326 has 21 scored results on Noometry and Muse Spark 1.2 has 31.

Related comparisons

Go deeper