Model comparison

Claude 3.7 Sonnet vs Mistral Medium

Claude 3.7 Sonnet is the stronger model overall, scoring 39.5 to 36.3 on the Noometry Index.

Last verified . 24 shared benchmarks.

Claude 3.7 Sonnet Anthropic

39.5

Rank #164 Confirmed

Mistral Medium Mistral AI

36.3

Rank #218 Confirmed

Summary

  • They share 24 benchmarks with published results for both. Claude 3.7 Sonnet scores higher in 5 categories and Mistral Medium in 5 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Claude 3.7 Sonnet leads 39.8 to 25.0.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 57.8% for Claude 3.7 Sonnet and 32.2% for Mistral Medium.
  • Mistral Medium has downloadable open weights; the other is API-only.

Side by side

Claude 3.7 Sonnet and Mistral Medium specifications
Claude 3.7 SonnetMistral Medium
ProviderAnthropicMistral AI
Noometry Index39.536.3
Released2025-02-242023-12-11
WeightsProprietaryOpen
Context window—262K
Max output—262K
Input $ / M tokens—$1.50
Output $ / M tokens—$7.50
Results tracked5836

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 40.6 (#136), Mistral Medium: 34.2 (#243)

Coding benchmarks
BenchmarkClaude 3.7 SonnetMistral Medium
LMArena Coding13611434
SWE-bench Verified61%—
FrontierCode—8%
SWE-bench Verified (bash only)52.8%—
Aider Polyglot64.9%—
SciCode—40.2%
GSO3.8%—
WeirdML—43.7%
LiveBench Coding74.5%—
CadEval54%—
ALE-Bench—763.98

Agentic & Tool Use Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 34.1 (#50), Mistral Medium: 28.3 (#90)

Agentic & Tool Use benchmarks
BenchmarkClaude 3.7 SonnetMistral Medium
Berkeley Function Calling Leaderboard—37.7%
TheAgentCompany30.9%—
Cybench20%—
DeepResearch Bench43.6%—
OSWorld35.8%—
METR Time Horizons60%—

Reasoning Mistral Medium leads

Claude 3.7 Sonnet: 18.6 (#277), Mistral Medium: 24.0 (#167)

Reasoning benchmarks
BenchmarkClaude 3.7 SonnetMistral Medium
LMArena Hard Prompts13331426
ARC-AGI-20.9%—
SimpleBench46.4%—
Kagi LLM Benchmark—50%
ARC-AGI-128.6%—
CritPt—0%
EnigmaEval4.2%—
LiveBench Reasoning87.8%—
DTBench—75.5%
LiveBench Data Analysis74%—
LMCA—26.1%
Surface Evolver Bench—26.9%
Epoch Capabilities Index141.16—
ForecastBench61.8—
LiveBench76.1%—

Math Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 37.5 (#153), Mistral Medium: 28.1 (#245)

Math benchmarks
BenchmarkClaude 3.7 SonnetMistral Medium
OTIS Mock AIME 2024-202557.8%32.2%
LMArena Math13371408
MATH Level 591.2%81.6%
FrontierMath (Feb 2025 set)4.1%0.3%
ProofBench—9%
Omni-MATH33%—
LiveBench Math79%—

Knowledge Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 39.8 (#130), Mistral Medium: 25.0 (#265)

Knowledge benchmarks
BenchmarkClaude 3.7 SonnetMistral Medium
GPQA Diamond79.7%59.5%
Humanity's Last Exam8%4.5%
LMArena Expert13211408
MMLU-Pro78.4%—
Confabulations14.7%—
Vectara Hallucination Rate—22.7%
GPQA (HELM)60.8%—

Multimodal Mistral Medium leads

Claude 3.7 Sonnet: 33.7 (#95), Mistral Medium: 35.3 (#88)

Multimodal benchmarks
BenchmarkClaude 3.7 SonnetMistral Medium
LMArena Vision11691172
GeoBench68%—
VPCT39%—
SpatialViz-Bench33.9%—

Multilingual Mistral Medium leads

Claude 3.7 Sonnet: 44.1 (#179), Mistral Medium: 52.1 (#91)

Multilingual benchmarks
BenchmarkClaude 3.7 SonnetMistral Medium
LMArena Non-English12961408
LMArena Chinese12991447
LMArena French13031459
LMArena German13011432
LMArena Japanese12671378
LMArena Korean12491380
LMArena Russian13111411
LMArena Spanish12981433

Instruction Following Too close to call

Claude 3.7 Sonnet: 72.9 (#125), Mistral Medium: 73.7 (#116)

Instruction Following benchmarks
BenchmarkClaude 3.7 SonnetMistral Medium
LMArena Instruction Following13521398
LiveBench Instruction Following81.3%—
IFEval83.4%—

Long Context Claude 3.7 Sonnet leads

Claude 3.7 Sonnet: 50.3 (#10), Mistral Medium: 42.9 (#114)

Long Context benchmarks
BenchmarkClaude 3.7 SonnetMistral Medium
LMArena Longer Query13731406
Fiction.LiveBench83.3%—

Writing & Preference Mistral Medium leads

Claude 3.7 Sonnet: 54.4 (#150), Mistral Medium: 60.0 (#103)

Writing & Preference benchmarks
BenchmarkClaude 3.7 SonnetMistral Medium
LMArena Text13141424
LMArena Creative Writing13321391
Short-Story Creative Writing81.1%77.3%
LMArena Multi-Turn13391418
EQ-Bench Creative Writing1412—
WildBench81.4%—
LiveBench Language59.9%—

Frequently asked questions

Is Claude 3.7 Sonnet better than Mistral Medium?

Claude 3.7 Sonnet is the stronger model overall, scoring 39.5 to 36.3 on the Noometry Index.

Is Claude 3.7 Sonnet or Mistral Medium better for coding?

Claude 3.7 Sonnet scores higher on coding benchmarks: 40.6 versus 34.2 in the Noometry coding category.

How many benchmarks do Claude 3.7 Sonnet and Mistral Medium share?

24 benchmarks have published results for both models. Claude 3.7 Sonnet has 58 scored results on Noometry and Mistral Medium has 36.

Related comparisons

Go deeper