Model comparison

Claude 3 Haiku vs Mistral Medium 3.5

Mistral Medium 3.5 is the stronger model overall, scoring 40.2 to 25.9 on the Noometry Index.

Last verified . 19 shared benchmarks.

Claude 3 Haiku Anthropic

25.9

Rank #340 Confirmed

Mistral Medium 3.5 Mistral AI

40.2

Rank #152 Confirmed

Summary

  • They share 19 benchmarks with published results for both. Claude 3 Haiku scores higher in 0 categories and Mistral Medium 3.5 in 9 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in math, where Mistral Medium 3.5 leads 39.1 to 9.8.
  • The biggest single-benchmark swing is Kagi LLM Benchmark: 34.2% for Claude 3 Haiku and 41.4% for Mistral Medium 3.5.
  • Mistral Medium 3.5 has downloadable open weights; the other is API-only.

Side by side

Claude 3 Haiku and Mistral Medium 3.5 specifications
Claude 3 HaikuMistral Medium 3.5
ProviderAnthropicMistral AI
Noometry Index25.940.2
Released2024-03-07—
WeightsProprietaryOpen
Context window—262K
Max output—210K
Input $ / M tokens—$1.50
Output $ / M tokens—$7.50
Results tracked3722

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Mistral Medium 3.5 leads

Claude 3 Haiku: 26.4 (#325), Mistral Medium 3.5: 36.0 (#213)

Coding benchmarks
BenchmarkClaude 3 HaikuMistral Medium 3.5
LMArena Coding11991461
LMArena WebDev—1264
WeirdML9.8%—
BigCodeBench Instruct39.4%—
BigCodeBench Complete50.1%—
CadEval12%—
HumanEval+68.9%—
MBPP+68.8%—

Reasoning Mistral Medium 3.5 leads

Claude 3 Haiku: 16.3 (#307), Mistral Medium 3.5: 17.3 (#295)

Reasoning benchmarks
BenchmarkClaude 3 HaikuMistral Medium 3.5
Kagi LLM Benchmark34.2%41.4%
LMArena Hard Prompts11741436
Epoch Capabilities Index118.35141.35
NYT Connections (extended)—12.9%
DTBench50.1%—
LMCA8.8%—
ForecastBench53.2—
WinoGrande74.2%—

Math Mistral Medium 3.5 leads

Claude 3 Haiku: 9.8 (#319), Mistral Medium 3.5: 39.1 (#113)

Math benchmarks
BenchmarkClaude 3 HaikuMistral Medium 3.5
LMArena Math11881431
OTIS Mock AIME 2024-20251.8%—
MATH Level 514.9%—

Knowledge Mistral Medium 3.5 leads

Claude 3 Haiku: 17.3 (#285), Mistral Medium 3.5: 40.0 (#126)

Knowledge benchmarks
BenchmarkClaude 3 HaikuMistral Medium 3.5
LMArena Expert11481432
GPQA Diamond36.3%—
Confabulations34.2%—
MMLU73.8%—

Multimodal Mistral Medium 3.5 leads

Claude 3 Haiku: 23.6 (#128), Mistral Medium 3.5: 38.3 (#65)

Multimodal benchmarks
BenchmarkClaude 3 HaikuMistral Medium 3.5
LMArena Vision9501223
ScienceQA72%—

Multilingual Mistral Medium 3.5 leads

Claude 3 Haiku: 36.0 (#243), Mistral Medium 3.5: 51.9 (#100)

Multilingual benchmarks
BenchmarkClaude 3 HaikuMistral Medium 3.5
LMArena Non-English11781404
LMArena Chinese11551442
LMArena French11951448
LMArena German11741451
LMArena Korean11091385
LMArena Russian12041395
LMArena Spanish11661409
LMArena Japanese1102—

Instruction Following Mistral Medium 3.5 leads

Claude 3 Haiku: 61.3 (#247), Mistral Medium 3.5: 74.6 (#90)

Instruction Following benchmarks
BenchmarkClaude 3 HaikuMistral Medium 3.5
LMArena Instruction Following11731415

Long Context Mistral Medium 3.5 leads

Claude 3 Haiku: 36.1 (#237), Mistral Medium 3.5: 43.2 (#103)

Long Context benchmarks
BenchmarkClaude 3 HaikuMistral Medium 3.5
LMArena Longer Query11901415

Writing & Preference Mistral Medium 3.5 leads

Claude 3 Haiku: 29.7 (#291), Mistral Medium 3.5: 58.5 (#117)

Writing & Preference benchmarks
BenchmarkClaude 3 HaikuMistral Medium 3.5
LMArena Text11951421
LMArena Creative Writing11571374
LMArena Multi-Turn11901423
EQ-Bench Creative Writing717—
EQ-Bench 4—993

Frequently asked questions

Is Claude 3 Haiku better than Mistral Medium 3.5?

Mistral Medium 3.5 is the stronger model overall, scoring 40.2 to 25.9 on the Noometry Index.

Is Claude 3 Haiku or Mistral Medium 3.5 better for coding?

Mistral Medium 3.5 scores higher on coding benchmarks: 36.0 versus 26.4 in the Noometry coding category.

How many benchmarks do Claude 3 Haiku and Mistral Medium 3.5 share?

19 benchmarks have published results for both models. Claude 3 Haiku has 37 scored results on Noometry and Mistral Medium 3.5 has 22.

Related comparisons

Go deeper