Model comparison

Chatgpt 4o Latest 20250326 vs Qwen3.7 Plus

Qwen3.7 Plus is the stronger model overall, scoring 45.3 to 43.8 on the Noometry Index.

Last verified . 18 shared benchmarks.

Chatgpt 4o Latest 20250326 OpenAI

43.8

Rank #82 Confirmed

Qwen3.7 Plus Alibaba (Qwen)

45.3

Rank #72 Confirmed

Summary

  • They share 18 benchmarks with published results for both. Chatgpt 4o Latest 20250326 scores higher in 1 category and Qwen3.7 Plus in 8 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Qwen3.7 Plus leads 54.9 to 39.2.

Side by side

Chatgpt 4o Latest 20250326 and Qwen3.7 Plus specifications
Chatgpt 4o Latest 20250326Qwen3.7 Plus
ProviderOpenAIAlibaba (Qwen)
Noometry Index43.845.3
Released—2026-06-02
WeightsProprietaryProprietary
Context window—1M
Max output—131K
Input $ / M tokens—$0.40
Output $ / M tokens—$1.60
Results tracked2132

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 41.6 (#122), Qwen3.7 Plus: 36.6 (#206)

Coding benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen3.7 Plus
LMArena Coding14131473
FrontierCode—10.2%
SciCode—45.5%

Agentic & Tool Use Not comparable

Chatgpt 4o Latest 20250326: —, Qwen3.7 Plus: 21.4 (#138)

Agentic & Tool Use benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen3.7 Plus
OSWorld 2.0—2.8%

Reasoning Qwen3.7 Plus leads

Chatgpt 4o Latest 20250326: 33.8 (#71), Qwen3.7 Plus: 39.3 (#59)

Reasoning benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen3.7 Plus
LMArena Hard Prompts14241460
Kagi LLM Benchmark75%—
NYT Connections (extended)—74.8%
CritPt—9.1%
Chess Puzzles—24%
Mystery Game Puzzles—17%
DTBench—84%
LMCA—37.6%
Epoch Capabilities Index—147.37

Math Qwen3.7 Plus leads

Chatgpt 4o Latest 20250326: 38.6 (#134), Qwen3.7 Plus: 50.5 (#56)

Math benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen3.7 Plus
LMArena Math14071466
FrontierMath (Tiers 1-3)—34.4%
OTIS Mock AIME 2024-2025—93.3%

Knowledge Qwen3.7 Plus leads

Chatgpt 4o Latest 20250326: 39.2 (#137), Qwen3.7 Plus: 54.9 (#51)

Knowledge benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen3.7 Plus
LMArena Expert14011467
GPQA Diamond—87.9%
Confabulations16.6%—

Multimodal Qwen3.7 Plus leads

Chatgpt 4o Latest 20250326: 39.6 (#58), Qwen3.7 Plus: 41.8 (#33)

Multimodal benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen3.7 Plus
LMArena Vision12431279
LMArena Document—1444

Multilingual Qwen3.7 Plus leads

Chatgpt 4o Latest 20250326: 52.9 (#76), Qwen3.7 Plus: 54.8 (#38)

Multilingual benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen3.7 Plus
LMArena Non-English14191445
LMArena Chinese14571510
LMArena French14461473
LMArena German14231471
LMArena Japanese14051413
LMArena Korean13961415
LMArena Russian14291457
LMArena Spanish14341457

Instruction Following Qwen3.7 Plus leads

Chatgpt 4o Latest 20250326: 74.0 (#107), Qwen3.7 Plus: 75.8 (#52)

Instruction Following benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen3.7 Plus
LMArena Instruction Following14031440

Long Context Qwen3.7 Plus leads

Chatgpt 4o Latest 20250326: 43.1 (#107), Qwen3.7 Plus: 44.5 (#65)

Long Context benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen3.7 Plus
LMArena Longer Query14131455

Writing & Preference Qwen3.7 Plus leads

Chatgpt 4o Latest 20250326: 62.6 (#72), Qwen3.7 Plus: 64.3 (#56)

Writing & Preference benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen3.7 Plus
LMArena Text14291455
LMArena Creative Writing14051439
LMArena Multi-Turn14541460
EQ-Bench Creative Writing1501—

Frequently asked questions

Is Chatgpt 4o Latest 20250326 better than Qwen3.7 Plus?

Qwen3.7 Plus is the stronger model overall, scoring 45.3 to 43.8 on the Noometry Index.

Is Chatgpt 4o Latest 20250326 or Qwen3.7 Plus better for coding?

Chatgpt 4o Latest 20250326 scores higher on coding benchmarks: 41.6 versus 36.6 in the Noometry coding category.

How many benchmarks do Chatgpt 4o Latest 20250326 and Qwen3.7 Plus share?

18 benchmarks have published results for both models. Chatgpt 4o Latest 20250326 has 21 scored results on Noometry and Qwen3.7 Plus has 32.

Related comparisons

Go deeper