Model comparison

Claude 2.1 vs ERNIE 5.1

ERNIE 5.1 is the stronger model overall, scoring 43.8 to 25.2 on the Noometry Index.

Last verified . 0 shared benchmarks.

Claude 2.1 Anthropic

25.2

Rank #345 Reported

ERNIE 5.1 Baidu

43.8

Rank #83 Confirmed

Summary

  • The widest gap is in math, where ERNIE 5.1 leads 40.3 to 10.2.

Side by side

Claude 2.1 and ERNIE 5.1 specifications
Claude 2.1ERNIE 5.1
ProviderAnthropicBaidu
Noometry Index25.243.8
Released2023-11-21—
WeightsProprietaryProprietary
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked719

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding ERNIE 5.1 leads

Claude 2.1: 26.2 (#327), ERNIE 5.1: 44.0 (#76)

Coding benchmarks
BenchmarkClaude 2.1ERNIE 5.1
WeirdML7.1%—
LMArena Coding—1488

Agentic & Tool Use Not comparable

Claude 2.1: —, ERNIE 5.1: —

Agentic & Tool Use benchmarks
BenchmarkClaude 2.1ERNIE 5.1
LMArena Search—1227

Reasoning Too close to call

Claude 2.1: 21.4 (#221), ERNIE 5.1: 21.9 (#211)

Reasoning benchmarks
BenchmarkClaude 2.1ERNIE 5.1
NYT Connections (extended)—23.4%
LMArena Hard Prompts—1481
DTBench51%—
Epoch Capabilities Index119.27—
ForecastBench54.2—

Math ERNIE 5.1 leads

Claude 2.1: 10.2 (#315), ERNIE 5.1: 40.3 (#92)

Math benchmarks
BenchmarkClaude 2.1ERNIE 5.1
OTIS Mock AIME 2024-20251.9%—
LMArena Math—1481

Knowledge ERNIE 5.1 leads

Claude 2.1: 15.4 (#292), ERNIE 5.1: 41.9 (#102)

Knowledge benchmarks
BenchmarkClaude 2.1ERNIE 5.1
GPQA Diamond33%—
LMArena Expert—1492
MMLU73.5%—

Multilingual Not comparable

Claude 2.1: —, ERNIE 5.1: 55.5 (#29)

Multilingual benchmarks
BenchmarkClaude 2.1ERNIE 5.1
LMArena Non-English—1454
LMArena Chinese—1508
LMArena French—1488
LMArena German—1470
LMArena Japanese—1422
LMArena Korean—1427
LMArena Russian—1459
LMArena Spanish—1473

Instruction Following Not comparable

Claude 2.1: —, ERNIE 5.1: 76.7 (#37)

Instruction Following benchmarks
BenchmarkClaude 2.1ERNIE 5.1
LMArena Instruction Following—1460

Long Context Not comparable

Claude 2.1: —, ERNIE 5.1: 44.7 (#59)

Long Context benchmarks
BenchmarkClaude 2.1ERNIE 5.1
LMArena Longer Query—1462

Writing & Preference Not comparable

Claude 2.1: —, ERNIE 5.1: 65.1 (#52)

Writing & Preference benchmarks
BenchmarkClaude 2.1ERNIE 5.1
LMArena Text—1468
LMArena Creative Writing—1441
LMArena Multi-Turn—1471

Frequently asked questions

Is Claude 2.1 better than ERNIE 5.1?

ERNIE 5.1 is the stronger model overall, scoring 43.8 to 25.2 on the Noometry Index.

Is Claude 2.1 or ERNIE 5.1 better for coding?

ERNIE 5.1 scores higher on coding benchmarks: 44.0 versus 26.2 in the Noometry coding category.

How many benchmarks do Claude 2.1 and ERNIE 5.1 share?

0 benchmarks have published results for both models. Claude 2.1 has 7 scored results on Noometry and ERNIE 5.1 has 19.

Related comparisons

Go deeper