# Claude 3.5 Sonnet vs Mistral

> Claude 3.5 Sonnet is the stronger model overall, scoring 34.6 to 29.9 on the Noometry Index.

- Canonical page: https://noometry.com/compare/claude-3-5-sonnet-vs-mistral
- Last updated: 2026-10-11
- Shared benchmarks: 22

## Summary

- They share 22 benchmarks with published results for both. Claude 3.5 Sonnet scores higher in 7 categories and Mistral in 1 category; 7 gaps are clear of the uncertainty.
- The widest gap is in instruction following, where Claude 3.5 Sonnet leads 68.8 to 52.6.
- The biggest single-benchmark swing is MMLU-Pro: 77.7% for Claude 3.5 Sonnet and 27.7% for Mistral.

## Snapshot

| | Claude 3.5 Sonnet | Mistral |
|---|---|---|
| Provider | Anthropic | Mistral AI |
| Noometry Index | 34.6 | 29.9 |
| Rank | 231 | 303 |
| Context | — | — |
| Input $/M | — | — |
| Output $/M | — | — |
| Weights | Proprietary | Proprietary |

## Coding

- Claude 3.5 Sonnet: 39.0 (#165)
- Mistral: 33.8 (#250)

| Benchmark | Claude 3.5 Sonnet | Mistral |
|---|---|---|
| LMArena Coding | 1342 | 1162 |
| Aider Polyglot | 51.6% | — |
| GSO | 4.6% | — |
| WeirdML | 40% | — |
| BigCodeBench Instruct | 46.8% | — |
| LiveBench Coding | 67.1% | — |
| BigCodeBench Complete | 58.6% | — |
| CadEval | 48% | — |
| HumanEval+ | 81.7% | — |
| MBPP+ | 74.3% | — |

## Agentic & Tool Use

- Claude 3.5 Sonnet: 32.3 (#67)
- Mistral: —

| Benchmark | Claude 3.5 Sonnet | Mistral |
|---|---|---|
| TheAgentCompany | 24% | — |
| Cybench | 17.5% | — |
| BALROG | 32.6% | — |
| METR Time Horizons | 45.2% | — |

## Reasoning

- Claude 3.5 Sonnet: 23.1 (#183)
- Mistral: 22.2 (#200)

| Benchmark | Claude 3.5 Sonnet | Mistral |
|---|---|---|
| LMArena Hard Prompts | 1305 | 1149 |
| SimpleBench | 41.4% | — |
| EnigmaEval | 0.9% | — |
| LiveBench Reasoning | 56.7% | — |
| DTBench | 67.8% | — |
| LiveBench Data Analysis | 55% | — |
| Epoch Capabilities Index | 133.55 | — |
| ForecastBench | 60.7 | — |
| LiveBench | 59% | — |

## Math

- Claude 3.5 Sonnet: 19.2 (#288)
- Mistral: 22.3 (#278)

| Benchmark | Claude 3.5 Sonnet | Mistral |
|---|---|---|
| Omni-MATH | 27.6% | 7.2% |
| LMArena Math | 1307 | 1180 |
| OTIS Mock AIME 2024-2025 | 8.5% | — |
| LiveBench Math | 52.3% | — |
| MATH Level 5 | 56.9% | — |
| FrontierMath (Feb 2025 set) | 2.1% | — |
| FrontierMath Tier 4 (v1) | 0% | — |

## Knowledge

- Claude 3.5 Sonnet: 28.6 (#245)
- Mistral: 16.6 (#288)

| Benchmark | Claude 3.5 Sonnet | Mistral |
|---|---|---|
| MMLU-Pro | 77.7% | 27.7% |
| GPQA (HELM) | 56.5% | 30.3% |
| LMArena Expert | 1265 | 1125 |
| GPQA Diamond | 55.3% | — |
| Humanity's Last Exam | 4.1% | — |
| Confabulations | 19.9% | — |
| MMLU | 87.3% | — |

## Multimodal

- Claude 3.5 Sonnet: 26.5 (#120)
- Mistral: —

| Benchmark | Claude 3.5 Sonnet | Mistral |
|---|---|---|
| LMArena Vision | 1125 | — |
| Video-MME | 60% | — |
| GeoBench | 62% | — |
| VPCT | 33% | — |

## Multilingual

- Claude 3.5 Sonnet: 43.2 (#185)
- Mistral: 32.8 (#254)

| Benchmark | Claude 3.5 Sonnet | Mistral |
|---|---|---|
| LMArena Non-English | 1283 | 1129 |
| LMArena Chinese | 1272 | 1109 |
| LMArena French | 1305 | 1180 |
| LMArena German | 1297 | 1155 |
| LMArena Japanese | 1234 | 1013 |
| LMArena Korean | 1200 | 1032 |
| LMArena Russian | 1306 | 1168 |
| LMArena Spanish | 1290 | 1143 |

## Instruction Following

- Claude 3.5 Sonnet: 68.8 (#182)
- Mistral: 52.6 (#288)

| Benchmark | Claude 3.5 Sonnet | Mistral |
|---|---|---|
| IFEval | 85.5% | 56.8% |
| LMArena Instruction Following | 1297 | 1152 |
| LiveBench Instruction Following | 69.3% | — |

## Long Context

- Claude 3.5 Sonnet: 39.9 (#167)
- Mistral: 35.0 (#245)

| Benchmark | Claude 3.5 Sonnet | Mistral |
|---|---|---|
| LMArena Longer Query | 1311 | 1153 |

## Writing & Preference

- Claude 3.5 Sonnet: 52.9 (#164)
- Mistral: 37.0 (#260)

| Benchmark | Claude 3.5 Sonnet | Mistral |
|---|---|---|
| LMArena Text | 1298 | 1165 |
| LMArena Creative Writing | 1292 | 1158 |
| WildBench | 79.2% | 66% |
| LMArena Multi-Turn | 1326 | 1147 |
| Short-Story Creative Writing | 80.3% | — |
| EQ-Bench Creative Writing | 1451 | — |
| LiveBench Language | 53.8% | — |

## FAQ

### Is Claude 3.5 Sonnet better than Mistral?

Claude 3.5 Sonnet is the stronger model overall, scoring 34.6 to 29.9 on the Noometry Index.

### Is Claude 3.5 Sonnet or Mistral better for coding?

Claude 3.5 Sonnet scores higher on coding benchmarks: 39.0 versus 33.8 in the Noometry coding category.

### How many benchmarks do Claude 3.5 Sonnet and Mistral share?

22 benchmarks have published results for both models. Claude 3.5 Sonnet has 60 scored results on Noometry and Mistral has 22.
