Model comparison

Chatgpt 4o Latest 20250326 vs Muse Spark

Muse Spark is the stronger model overall, scoring 50.6 to 43.8 on the Noometry Index.

Last verified . 17 shared benchmarks.

Chatgpt 4o Latest 20250326 OpenAI

43.8

Rank #82 Confirmed

Muse Spark Meta

50.6

Rank #46 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Chatgpt 4o Latest 20250326 scores higher in 0 categories and Muse Spark in 9 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Muse Spark leads 65.7 to 39.2.

Side by side

Chatgpt 4o Latest 20250326 and Muse Spark specifications
Chatgpt 4o Latest 20250326Muse Spark
ProviderOpenAIMeta
Noometry Index43.850.6
Released—2026-04-08
WeightsProprietaryProprietary
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked2127

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Muse Spark leads

Chatgpt 4o Latest 20250326: 41.6 (#122), Muse Spark: 46.2 (#69)

Coding benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark
LMArena Coding14131481
SciCode—51.5%

Reasoning Muse Spark leads

Chatgpt 4o Latest 20250326: 33.8 (#71), Muse Spark: 35.9 (#67)

Reasoning benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark
LMArena Hard Prompts14241474
Kagi LLM Benchmark75%—
CritPt—11.3%
Epoch Capabilities Index—152.04

Math Muse Spark leads

Chatgpt 4o Latest 20250326: 38.6 (#134), Muse Spark: 47.8 (#66)

Math benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark
LMArena Math14071455
OTIS Mock AIME 2024-2025—88.9%
ProofBench—17%
FrontierMath (Feb 2025 set)—39%
FrontierMath Tier 4 (v1)—14.6%

Knowledge Muse Spark leads

Chatgpt 4o Latest 20250326: 39.2 (#137), Muse Spark: 65.7 (#13)

Knowledge benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark
LMArena Expert14011457
GPQA Diamond—89.8%
Humanity's Last Exam—40.6%
Confabulations16.6%—

Multimodal Muse Spark leads

Chatgpt 4o Latest 20250326: 39.6 (#58), Muse Spark: 43.4 (#24)

Multimodal benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark
LMArena Vision12431306
LMArena Document—1444

Multilingual Muse Spark leads

Chatgpt 4o Latest 20250326: 52.9 (#76), Muse Spark: 56.1 (#24)

Multilingual benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark
LMArena Non-English14191464
LMArena Chinese14571509
LMArena French14461497
LMArena German14231497
LMArena Korean13961459
LMArena Russian14291466
LMArena Spanish14341472
LMArena Japanese1405—

Instruction Following Muse Spark leads

Chatgpt 4o Latest 20250326: 74.0 (#107), Muse Spark: 75.9 (#51)

Instruction Following benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark
LMArena Instruction Following14031442

Long Context Muse Spark leads

Chatgpt 4o Latest 20250326: 43.1 (#107), Muse Spark: 44.4 (#69)

Long Context benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark
LMArena Longer Query14131451

Writing & Preference Muse Spark leads

Chatgpt 4o Latest 20250326: 62.6 (#72), Muse Spark: 66.0 (#39)

Writing & Preference benchmarks
BenchmarkChatgpt 4o Latest 20250326Muse Spark
LMArena Text14291474
LMArena Creative Writing14051459
LMArena Multi-Turn14541477
EQ-Bench Creative Writing1501—

Frequently asked questions

Is Chatgpt 4o Latest 20250326 better than Muse Spark?

Muse Spark is the stronger model overall, scoring 50.6 to 43.8 on the Noometry Index.

Is Chatgpt 4o Latest 20250326 or Muse Spark better for coding?

Muse Spark scores higher on coding benchmarks: 46.2 versus 41.6 in the Noometry coding category.

How many benchmarks do Chatgpt 4o Latest 20250326 and Muse Spark share?

17 benchmarks have published results for both models. Chatgpt 4o Latest 20250326 has 21 scored results on Noometry and Muse Spark has 27.

Related comparisons

Go deeper