Model comparison

Claude 3.5 Sonnet vs Mistral Large

Claude 3.5 Sonnet is the stronger model overall, scoring 34.6 to 31.9 on the Noometry Index.

Last verified . 45 shared benchmarks.

Claude 3.5 Sonnet Anthropic

34.6

Rank #231 Confirmed

Mistral Large Mistral AI

31.9

Rank #263 Confirmed

Summary

  • They share 45 benchmarks with published results for both. Claude 3.5 Sonnet scores higher in 8 categories and Mistral Large in 1 category; 7 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Claude 3.5 Sonnet leads 52.9 to 40.7.
  • The biggest single-benchmark swing is BigCodeBench Complete: 58.6% for Claude 3.5 Sonnet and 38.3% for Mistral Large.
  • Mistral Large has downloadable open weights; the other is API-only.

Side by side

Claude 3.5 Sonnet and Mistral Large specifications
Claude 3.5 SonnetMistral Large
ProviderAnthropicMistral AI
Noometry Index34.631.9
Released2024-06-202024-02-26
WeightsProprietaryOpen
Context window—131K
Max output—16K
Input $ / M tokens—$2
Output $ / M tokens—$6
Results tracked6051

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 39.0 (#165), Mistral Large: 34.3 (#240)

Coding benchmarks
BenchmarkClaude 3.5 SonnetMistral Large
BigCodeBench Instruct46.8%30%
LiveBench Coding67.1%47.1%
LMArena Coding13421277
BigCodeBench Complete58.6%38.3%
HumanEval+81.7%62.2%
MBPP+74.3%59.5%
Aider Polyglot51.6%—
SciCode—36.2%
GSO4.6%—
WeirdML40%—
CadEval48%—
ALE-Bench—264.7

Agentic & Tool Use Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 32.3 (#67), Mistral Large: 28.6 (#89)

Agentic & Tool Use benchmarks
BenchmarkClaude 3.5 SonnetMistral Large
Berkeley Function Calling Leaderboard—38.4%
TheAgentCompany24%—
Cybench17.5%—
BALROG32.6%—
METR Time Horizons45.2%—

Reasoning Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 23.1 (#183), Mistral Large: 15.8 (#310)

Reasoning benchmarks
BenchmarkClaude 3.5 SonnetMistral Large
SimpleBench41.4%22.5%
LiveBench Reasoning56.7%43.5%
LMArena Hard Prompts13051257
DTBench67.8%65.1%
LiveBench Data Analysis55%50.1%
Epoch Capabilities Index133.55128.52
ForecastBench60.757.1
LiveBench59%48.4%
CritPt—0%
EnigmaEval0.9%—
LMCA—16.7%

Math Too close to call

Claude 3.5 Sonnet: 19.2 (#288), Mistral Large: 18.2 (#291)

Math benchmarks
BenchmarkClaude 3.5 SonnetMistral Large
OTIS Mock AIME 2024-20258.5%8.5%
Omni-MATH27.6%28.1%
LiveBench Math52.3%42.5%
LMArena Math13071262
MATH Level 556.9%50.3%
FrontierMath (Feb 2025 set)2.1%0.3%
FrontierMath Tier 4 (v1)0%—

Knowledge Mistral Large leads

Claude 3.5 Sonnet: 28.6 (#245), Mistral Large: 30.1 (#230)

Knowledge benchmarks
BenchmarkClaude 3.5 SonnetMistral Large
GPQA Diamond55.3%51.3%
MMLU-Pro77.7%59.9%
Confabulations19.9%21.4%
GPQA (HELM)56.5%43.5%
LMArena Expert12651232
MMLU87.3%80%
Humanity's Last Exam4.1%—
Vectara Hallucination Rate—4.5%

Multimodal Not comparable

Claude 3.5 Sonnet: 26.5 (#120), Mistral Large: —

Multimodal benchmarks
BenchmarkClaude 3.5 SonnetMistral Large
LMArena Vision1125—
Video-MME60%—
GeoBench62%—
VPCT33%—

Multilingual Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 43.2 (#185), Mistral Large: 40.0 (#219)

Multilingual benchmarks
BenchmarkClaude 3.5 SonnetMistral Large
LMArena Non-English12831237
LMArena Chinese12721240
LMArena French13051325
LMArena German12971254
LMArena Japanese12341188
LMArena Korean12001202
LMArena Russian13061257
LMArena Spanish12901268

Instruction Following Too close to call

Claude 3.5 Sonnet: 68.8 (#182), Mistral Large: 67.9 (#191)

Instruction Following benchmarks
BenchmarkClaude 3.5 SonnetMistral Large
LiveBench Instruction Following69.3%67.9%
IFEval85.5%87.7%
LMArena Instruction Following12971249

Long Context Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 39.9 (#167), Mistral Large: 38.3 (#199)

Long Context benchmarks
BenchmarkClaude 3.5 SonnetMistral Large
LMArena Longer Query13111261

Writing & Preference Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 52.9 (#164), Mistral Large: 40.7 (#242)

Writing & Preference benchmarks
BenchmarkClaude 3.5 SonnetMistral Large
LMArena Text12981266
LMArena Creative Writing12921243
Short-Story Creative Writing80.3%69%
EQ-Bench Creative Writing1451985
WildBench79.2%80.1%
LMArena Multi-Turn13261260
LiveBench Language53.8%39.4%

Frequently asked questions

Is Claude 3.5 Sonnet better than Mistral Large?

Claude 3.5 Sonnet is the stronger model overall, scoring 34.6 to 31.9 on the Noometry Index.

Is Claude 3.5 Sonnet or Mistral Large better for coding?

Claude 3.5 Sonnet scores higher on coding benchmarks: 39.0 versus 34.3 in the Noometry coding category.

How many benchmarks do Claude 3.5 Sonnet and Mistral Large share?

45 benchmarks have published results for both models. Claude 3.5 Sonnet has 60 scored results on Noometry and Mistral Large has 51.

Related comparisons

Go deeper