Model comparison

Claude 3.5 Sonnet vs Mistral Medium

Mistral Medium is the stronger model overall, scoring 36.3 to 34.6 on the Noometry Index.

Last verified . 26 shared benchmarks.

Claude 3.5 Sonnet Anthropic

34.6

Rank #231 Confirmed

Mistral Medium Mistral AI

36.3

Rank #218 Confirmed

Summary

  • They share 26 benchmarks with published results for both. Claude 3.5 Sonnet scores higher in 3 categories and Mistral Medium in 7 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in multilingual, where Mistral Medium leads 52.1 to 43.2.
  • The biggest single-benchmark swing is MATH Level 5: 56.9% for Claude 3.5 Sonnet and 81.6% for Mistral Medium.
  • Mistral Medium has downloadable open weights; the other is API-only.

Side by side

Claude 3.5 Sonnet and Mistral Medium specifications
Claude 3.5 SonnetMistral Medium
ProviderAnthropicMistral AI
Noometry Index34.636.3
Released2024-06-202023-12-11
WeightsProprietaryOpen
Context window—262K
Max output—262K
Input $ / M tokens—$1.50
Output $ / M tokens—$7.50
Results tracked6036

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 39.0 (#165), Mistral Medium: 34.2 (#243)

Coding benchmarks
BenchmarkClaude 3.5 SonnetMistral Medium
WeirdML40%43.7%
LMArena Coding13421434
FrontierCode—8%
Aider Polyglot51.6%—
SciCode—40.2%
GSO4.6%—
BigCodeBench Instruct46.8%—
LiveBench Coding67.1%—
BigCodeBench Complete58.6%—
CadEval48%—
ALE-Bench—763.98
HumanEval+81.7%—
MBPP+74.3%—

Agentic & Tool Use Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 32.3 (#67), Mistral Medium: 28.3 (#90)

Agentic & Tool Use benchmarks
BenchmarkClaude 3.5 SonnetMistral Medium
Berkeley Function Calling Leaderboard—37.7%
TheAgentCompany24%—
Cybench17.5%—
BALROG32.6%—
METR Time Horizons45.2%—

Reasoning Too close to call

Claude 3.5 Sonnet: 23.1 (#183), Mistral Medium: 24.0 (#167)

Reasoning benchmarks
BenchmarkClaude 3.5 SonnetMistral Medium
LMArena Hard Prompts13051426
DTBench67.8%75.5%
SimpleBench41.4%—
Kagi LLM Benchmark—50%
CritPt—0%
EnigmaEval0.9%—
LiveBench Reasoning56.7%—
LiveBench Data Analysis55%—
LMCA—26.1%
Surface Evolver Bench—26.9%
Epoch Capabilities Index133.55—
ForecastBench60.7—
LiveBench59%—

Math Mistral Medium leads

Claude 3.5 Sonnet: 19.2 (#288), Mistral Medium: 28.1 (#245)

Math benchmarks
BenchmarkClaude 3.5 SonnetMistral Medium
OTIS Mock AIME 2024-20258.5%32.2%
LMArena Math13071408
MATH Level 556.9%81.6%
FrontierMath (Feb 2025 set)2.1%0.3%
ProofBench—9%
Omni-MATH27.6%—
LiveBench Math52.3%—
FrontierMath Tier 4 (v1)0%—

Knowledge Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 28.6 (#245), Mistral Medium: 25.0 (#265)

Knowledge benchmarks
BenchmarkClaude 3.5 SonnetMistral Medium
GPQA Diamond55.3%59.5%
Humanity's Last Exam4.1%4.5%
LMArena Expert12651408
MMLU-Pro77.7%—
Confabulations19.9%—
Vectara Hallucination Rate—22.7%
GPQA (HELM)56.5%—
MMLU87.3%—

Multimodal Mistral Medium leads

Claude 3.5 Sonnet: 26.5 (#120), Mistral Medium: 35.3 (#88)

Multimodal benchmarks
BenchmarkClaude 3.5 SonnetMistral Medium
LMArena Vision11251172
Video-MME60%—
GeoBench62%—
VPCT33%—

Multilingual Mistral Medium leads

Claude 3.5 Sonnet: 43.2 (#185), Mistral Medium: 52.1 (#91)

Multilingual benchmarks
BenchmarkClaude 3.5 SonnetMistral Medium
LMArena Non-English12831408
LMArena Chinese12721447
LMArena French13051459
LMArena German12971432
LMArena Japanese12341378
LMArena Korean12001380
LMArena Russian13061411
LMArena Spanish12901433

Instruction Following Mistral Medium leads

Claude 3.5 Sonnet: 68.8 (#182), Mistral Medium: 73.7 (#116)

Instruction Following benchmarks
BenchmarkClaude 3.5 SonnetMistral Medium
LMArena Instruction Following12971398
LiveBench Instruction Following69.3%—
IFEval85.5%—

Long Context Mistral Medium leads

Claude 3.5 Sonnet: 39.9 (#167), Mistral Medium: 42.9 (#114)

Long Context benchmarks
BenchmarkClaude 3.5 SonnetMistral Medium
LMArena Longer Query13111406

Writing & Preference Mistral Medium leads

Claude 3.5 Sonnet: 52.9 (#164), Mistral Medium: 60.0 (#103)

Writing & Preference benchmarks
BenchmarkClaude 3.5 SonnetMistral Medium
LMArena Text12981424
LMArena Creative Writing12921391
Short-Story Creative Writing80.3%77.3%
LMArena Multi-Turn13261418
EQ-Bench Creative Writing1451—
WildBench79.2%—
LiveBench Language53.8%—

Frequently asked questions

Is Claude 3.5 Sonnet better than Mistral Medium?

Mistral Medium is the stronger model overall, scoring 36.3 to 34.6 on the Noometry Index.

Is Claude 3.5 Sonnet or Mistral Medium better for coding?

Claude 3.5 Sonnet scores higher on coding benchmarks: 39.0 versus 34.2 in the Noometry coding category.

How many benchmarks do Claude 3.5 Sonnet and Mistral Medium share?

26 benchmarks have published results for both models. Claude 3.5 Sonnet has 60 scored results on Noometry and Mistral Medium has 36.

Related comparisons

Go deeper