Model comparison

Chatgpt 4o Latest 20250326 vs Qwen Plus

Chatgpt 4o Latest 20250326 is the stronger model overall, scoring 43.8 to 37.1 on the Noometry Index.

Last verified . 14 shared benchmarks.

Chatgpt 4o Latest 20250326 OpenAI

43.8

Rank #82 Confirmed

Qwen Plus Alibaba (Qwen)

37.1

Rank #210 Confirmed

Summary

  • They share 14 benchmarks with published results for both. Chatgpt 4o Latest 20250326 scores higher in 8 categories and Qwen Plus in 0 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Chatgpt 4o Latest 20250326 leads 38.6 to 23.3.
  • The biggest single-benchmark swing is Kagi LLM Benchmark: 75% for Chatgpt 4o Latest 20250326 and 63.3% for Qwen Plus.

Side by side

Chatgpt 4o Latest 20250326 and Qwen Plus specifications
Chatgpt 4o Latest 20250326Qwen Plus
ProviderOpenAIAlibaba (Qwen)
Noometry Index43.837.1
Released—2024-01-25
WeightsProprietaryProprietary
Context window—1M
Max output—33K
Input $ / M tokens—$0.40
Output $ / M tokens—$1.20
Results tracked2120

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 41.6 (#122), Qwen Plus: 38.9 (#167)

Coding benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen Plus
LMArena Coding14131328

Reasoning Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 33.8 (#71), Qwen Plus: 28.4 (#107)

Reasoning benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen Plus
Kagi LLM Benchmark75%63.3%
LMArena Hard Prompts14241317
DTBench—81.1%
LMCA—24%

Math Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 38.6 (#134), Qwen Plus: 23.3 (#271)

Math benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen Plus
LMArena Math14071326
OTIS Mock AIME 2024-2025—17.8%
MATH Level 5—65.3%
FrontierMath (Feb 2025 set)—1.7%

Knowledge Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 39.2 (#137), Qwen Plus: 27.4 (#251)

Knowledge benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen Plus
LMArena Expert14011328
GPQA Diamond—48.1%
Confabulations16.6%—

Multimodal Not comparable

Chatgpt 4o Latest 20250326: 39.6 (#58), Qwen Plus: —

Multimodal benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen Plus
LMArena Vision1243—

Multilingual Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 52.9 (#76), Qwen Plus: 45.1 (#175)

Multilingual benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen Plus
LMArena Non-English14191310
LMArena Chinese14571347
LMArena Japanese14051251
LMArena Russian14291323
LMArena French1446—
LMArena German1423—
LMArena Korean1396—
LMArena Spanish1434—

Instruction Following Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 74.0 (#107), Qwen Plus: 68.8 (#181)

Instruction Following benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen Plus
LMArena Instruction Following14031303

Long Context Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 43.1 (#107), Qwen Plus: 40.3 (#158)

Long Context benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen Plus
LMArena Longer Query14131324

Writing & Preference Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 62.6 (#72), Qwen Plus: 52.2 (#176)

Writing & Preference benchmarks
BenchmarkChatgpt 4o Latest 20250326Qwen Plus
LMArena Text14291326
LMArena Creative Writing14051293
LMArena Multi-Turn14541336
EQ-Bench Creative Writing1501—

Frequently asked questions

Is Chatgpt 4o Latest 20250326 better than Qwen Plus?

Chatgpt 4o Latest 20250326 is the stronger model overall, scoring 43.8 to 37.1 on the Noometry Index.

Is Chatgpt 4o Latest 20250326 or Qwen Plus better for coding?

Chatgpt 4o Latest 20250326 scores higher on coding benchmarks: 41.6 versus 38.9 in the Noometry coding category.

How many benchmarks do Chatgpt 4o Latest 20250326 and Qwen Plus share?

14 benchmarks have published results for both models. Chatgpt 4o Latest 20250326 has 21 scored results on Noometry and Qwen Plus has 20.

Related comparisons

Go deeper