Model comparison

Claude 3 Sonnet vs Mistral Large

Mistral Large is the stronger model overall, scoring 31.9 to 29.0 on the Noometry Index.

Last verified . 27 shared benchmarks.

Claude 3 Sonnet Anthropic

29.0

Rank #319 Confirmed

Mistral Large Mistral AI

31.9

Rank #263 Confirmed

Summary

  • They share 27 benchmarks with published results for both. Claude 3 Sonnet scores higher in 2 categories and Mistral Large in 6 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Mistral Large leads 30.1 to 21.1.
  • The biggest single-benchmark swing is MATH Level 5: 18.2% for Claude 3 Sonnet and 50.3% for Mistral Large.
  • Mistral Large has downloadable open weights; the other is API-only.

Side by side

Claude 3 Sonnet and Mistral Large specifications
Claude 3 SonnetMistral Large
ProviderAnthropicMistral AI
Noometry Index29.031.9
Released2024-02-292024-02-26
WeightsProprietaryOpen
Context window—131K
Max output—16K
Input $ / M tokens—$2
Output $ / M tokens—$6
Results tracked3051

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Mistral Large leads

Claude 3 Sonnet: 29.6 (#302), Mistral Large: 34.3 (#240)

Coding benchmarks
BenchmarkClaude 3 SonnetMistral Large
BigCodeBench Instruct42.7%30%
LMArena Coding12231277
BigCodeBench Complete53.8%38.3%
HumanEval+64%62.2%
MBPP+69.3%59.5%
SciCode—36.2%
WeirdML10.2%—
LiveBench Coding—47.1%
ALE-Bench—264.7

Agentic & Tool Use Not comparable

Claude 3 Sonnet: —, Mistral Large: 28.6 (#89)

Agentic & Tool Use benchmarks
BenchmarkClaude 3 SonnetMistral Large
Berkeley Function Calling Leaderboard—38.4%

Reasoning Claude 3 Sonnet leads

Claude 3 Sonnet: 20.5 (#237), Mistral Large: 15.8 (#310)

Reasoning benchmarks
BenchmarkClaude 3 SonnetMistral Large
LMArena Hard Prompts11971257
DTBench53.6%65.1%
Epoch Capabilities Index120.7128.52
SimpleBench—22.5%
CritPt—0%
LiveBench Reasoning—43.5%
LiveBench Data Analysis—50.1%
LMCA—16.7%
ForecastBench—57.1
LiveBench—48.4%
WinoGrande75.1%—

Math Mistral Large leads

Claude 3 Sonnet: 10.7 (#310), Mistral Large: 18.2 (#291)

Math benchmarks
BenchmarkClaude 3 SonnetMistral Large
OTIS Mock AIME 2024-20252.5%8.5%
LMArena Math12131262
MATH Level 518.2%50.3%
Omni-MATH—28.1%
LiveBench Math—42.5%
FrontierMath (Feb 2025 set)—0.3%

Knowledge Mistral Large leads

Claude 3 Sonnet: 21.1 (#276), Mistral Large: 30.1 (#230)

Knowledge benchmarks
BenchmarkClaude 3 SonnetMistral Large
GPQA Diamond40.6%51.3%
LMArena Expert11731232
MMLU75.9%80%
MMLU-Pro—59.9%
Confabulations—21.4%
Vectara Hallucination Rate—4.5%
GPQA (HELM)—43.5%

Multimodal Not comparable

Claude 3 Sonnet: 25.2 (#125), Mistral Large: —

Multimodal benchmarks
BenchmarkClaude 3 SonnetMistral Large
LMArena Vision984—

Multilingual Mistral Large leads

Claude 3 Sonnet: 37.8 (#234), Mistral Large: 40.0 (#219)

Multilingual benchmarks
BenchmarkClaude 3 SonnetMistral Large
LMArena Non-English12051237
LMArena Chinese11891240
LMArena French12291325
LMArena German12041254
LMArena Japanese11311188
LMArena Korean11281202
LMArena Russian12271257
LMArena Spanish12041268

Instruction Following Mistral Large leads

Claude 3 Sonnet: 62.8 (#235), Mistral Large: 67.9 (#191)

Instruction Following benchmarks
BenchmarkClaude 3 SonnetMistral Large
LMArena Instruction Following11991249
LiveBench Instruction Following—67.9%
IFEval—87.7%

Long Context Mistral Large leads

Claude 3 Sonnet: 36.7 (#228), Mistral Large: 38.3 (#199)

Long Context benchmarks
BenchmarkClaude 3 SonnetMistral Large
LMArena Longer Query12111261

Writing & Preference Claude 3 Sonnet leads

Claude 3 Sonnet: 42.1 (#238), Mistral Large: 40.7 (#242)

Writing & Preference benchmarks
BenchmarkClaude 3 SonnetMistral Large
LMArena Text12181266
LMArena Creative Writing11861243
LMArena Multi-Turn12271260
Short-Story Creative Writing—69%
EQ-Bench Creative Writing—985
WildBench—80.1%
LiveBench Language—39.4%

Frequently asked questions

Is Claude 3 Sonnet better than Mistral Large?

Mistral Large is the stronger model overall, scoring 31.9 to 29.0 on the Noometry Index.

Is Claude 3 Sonnet or Mistral Large better for coding?

Mistral Large scores higher on coding benchmarks: 34.3 versus 29.6 in the Noometry coding category.

How many benchmarks do Claude 3 Sonnet and Mistral Large share?

27 benchmarks have published results for both models. Claude 3 Sonnet has 30 scored results on Noometry and Mistral Large has 51.

Related comparisons

Go deeper