Model comparison

ERNIE 5.1 vs Qwen3.7 Plus

Qwen3.7 Plus is the stronger model overall, scoring 45.3 to 43.8 on the Noometry Index.

Last verified . 18 shared benchmarks.

ERNIE 5.1 Baidu

43.8

Rank #83 Confirmed

Qwen3.7 Plus Alibaba (Qwen)

45.3

Rank #72 Confirmed

Summary

  • They share 18 benchmarks with published results for both. ERNIE 5.1 scores higher in 5 categories and Qwen3.7 Plus in 3 categories; 4 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Qwen3.7 Plus leads 39.3 to 21.9.
  • The biggest single-benchmark swing is NYT Connections (extended): 23.4% for ERNIE 5.1 and 74.8% for Qwen3.7 Plus.

Side by side

ERNIE 5.1 and Qwen3.7 Plus specifications
ERNIE 5.1Qwen3.7 Plus
ProviderBaiduAlibaba (Qwen)
Noometry Index43.845.3
Released—2026-06-02
WeightsProprietaryProprietary
Context window—1M
Max output—131K
Input $ / M tokens—$0.40
Output $ / M tokens—$1.60
Results tracked1932

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding ERNIE 5.1 leads

ERNIE 5.1: 44.0 (#76), Qwen3.7 Plus: 36.6 (#206)

Coding benchmarks
BenchmarkERNIE 5.1Qwen3.7 Plus
LMArena Coding14881473
FrontierCode—10.2%
SciCode—45.5%

Agentic & Tool Use Not comparable

ERNIE 5.1: —, Qwen3.7 Plus: 21.4 (#138)

Agentic & Tool Use benchmarks
BenchmarkERNIE 5.1Qwen3.7 Plus
OSWorld 2.0—2.8%
LMArena Search1227—

Reasoning Qwen3.7 Plus leads

ERNIE 5.1: 21.9 (#211), Qwen3.7 Plus: 39.3 (#59)

Reasoning benchmarks
BenchmarkERNIE 5.1Qwen3.7 Plus
NYT Connections (extended)23.4%74.8%
LMArena Hard Prompts14811460
CritPt—9.1%
Chess Puzzles—24%
Mystery Game Puzzles—17%
DTBench—84%
LMCA—37.6%
Epoch Capabilities Index—147.37

Math Qwen3.7 Plus leads

ERNIE 5.1: 40.3 (#92), Qwen3.7 Plus: 50.5 (#56)

Math benchmarks
BenchmarkERNIE 5.1Qwen3.7 Plus
LMArena Math14811466
FrontierMath (Tiers 1-3)—34.4%
OTIS Mock AIME 2024-2025—93.3%

Knowledge Qwen3.7 Plus leads

ERNIE 5.1: 41.9 (#102), Qwen3.7 Plus: 54.9 (#51)

Knowledge benchmarks
BenchmarkERNIE 5.1Qwen3.7 Plus
LMArena Expert14921467
GPQA Diamond—87.9%

Multimodal Not comparable

ERNIE 5.1: —, Qwen3.7 Plus: 41.8 (#33)

Multimodal benchmarks
BenchmarkERNIE 5.1Qwen3.7 Plus
LMArena Vision—1279
LMArena Document—1444

Multilingual Too close to call

ERNIE 5.1: 55.5 (#29), Qwen3.7 Plus: 54.8 (#38)

Multilingual benchmarks
BenchmarkERNIE 5.1Qwen3.7 Plus
LMArena Non-English14541445
LMArena Chinese15081510
LMArena French14881473
LMArena German14701471
LMArena Japanese14221413
LMArena Korean14271415
LMArena Russian14591457
LMArena Spanish14731457

Instruction Following Too close to call

ERNIE 5.1: 76.7 (#37), Qwen3.7 Plus: 75.8 (#52)

Instruction Following benchmarks
BenchmarkERNIE 5.1Qwen3.7 Plus
LMArena Instruction Following14601440

Long Context Too close to call

ERNIE 5.1: 44.7 (#59), Qwen3.7 Plus: 44.5 (#65)

Long Context benchmarks
BenchmarkERNIE 5.1Qwen3.7 Plus
LMArena Longer Query14621455

Writing & Preference Too close to call

ERNIE 5.1: 65.1 (#52), Qwen3.7 Plus: 64.3 (#56)

Writing & Preference benchmarks
BenchmarkERNIE 5.1Qwen3.7 Plus
LMArena Text14681455
LMArena Creative Writing14411439
LMArena Multi-Turn14711460

Frequently asked questions

Is ERNIE 5.1 better than Qwen3.7 Plus?

Qwen3.7 Plus is the stronger model overall, scoring 45.3 to 43.8 on the Noometry Index.

Is ERNIE 5.1 or Qwen3.7 Plus better for coding?

ERNIE 5.1 scores higher on coding benchmarks: 44.0 versus 36.6 in the Noometry coding category.

How many benchmarks do ERNIE 5.1 and Qwen3.7 Plus share?

18 benchmarks have published results for both models. ERNIE 5.1 has 19 scored results on Noometry and Qwen3.7 Plus has 32.

Related comparisons

Go deeper