Model comparison

Mistral Large vs o1-mini

o1-mini is the stronger model overall, scoring 34.0 to 31.9 on the Noometry Index.

Last verified . 34 shared benchmarks.

Mistral Large Mistral AI

31.9

Rank #263 Confirmed

o1-mini OpenAI

34.0

Rank #235 Confirmed

Summary

  • They share 34 benchmarks with published results for both. Mistral Large scores higher in 3 categories and o1-mini in 6 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in math, where o1-mini leads 35.4 to 18.2.
  • The biggest single-benchmark swing is MATH Level 5: 50.3% for Mistral Large and 89.2% for o1-mini.
  • Mistral Large has downloadable open weights; the other is API-only.

Side by side

Mistral Large and o1-mini specifications
Mistral Largeo1-mini
ProviderMistral AIOpenAI
Noometry Index31.934.0
Released2024-02-262024-09-12
WeightsOpenProprietary
Context window131K—
Max output16K—
Input $ / M tokens$2—
Output $ / M tokens$6—
Results tracked5139

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding o1-mini leads

Mistral Large: 34.3 (#240), o1-mini: 35.5 (#224)

Coding benchmarks
BenchmarkMistral Largeo1-mini
LiveBench Coding47.1%48%
LMArena Coding12771362
HumanEval+62.2%89%
MBPP+59.5%78.8%
Aider Polyglot—32.9%
SciCode36.2%—
WeirdML—36.3%
BigCodeBench Instruct30%—
BigCodeBench Complete38.3%—
ALE-Bench264.7—

Agentic & Tool Use Mistral Large leads

Mistral Large: 28.6 (#89), o1-mini: 24.6 (#118)

Agentic & Tool Use benchmarks
BenchmarkMistral Largeo1-mini
Berkeley Function Calling Leaderboard38.4%—
Cybench—10%

Reasoning Mistral Large leads

Mistral Large: 15.8 (#310), o1-mini: 8.8 (#346)

Reasoning benchmarks
BenchmarkMistral Largeo1-mini
SimpleBench22.5%18.1%
LiveBench Reasoning43.5%72.3%
LMArena Hard Prompts12571333
LiveBench Data Analysis50.1%57.9%
Epoch Capabilities Index128.52135.82
LiveBench48.4%57.8%
ARC-AGI-2—0.8%
ARC-AGI-1—14%
CritPt0%—
DTBench65.1%—
LMCA16.7%—
ForecastBench57.1—

Math o1-mini leads

Mistral Large: 18.2 (#291), o1-mini: 35.4 (#186)

Math benchmarks
BenchmarkMistral Largeo1-mini
OTIS Mock AIME 2024-20258.5%46.9%
LiveBench Math42.5%62%
LMArena Math12621358
MATH Level 550.3%89.2%
FrontierMath (Feb 2025 set)0.3%1.7%
Omni-MATH28.1%—

Knowledge o1-mini leads

Mistral Large: 30.1 (#230), o1-mini: 34.9 (#192)

Knowledge benchmarks
BenchmarkMistral Largeo1-mini
GPQA Diamond51.3%62.4%
Confabulations21.4%18.6%
LMArena Expert12321316
MMLU-Pro59.9%—
Vectara Hallucination Rate4.5%—
GPQA (HELM)43.5%—
MMLU80%—

Multilingual o1-mini leads

Mistral Large: 40.0 (#219), o1-mini: 43.6 (#182)

Multilingual benchmarks
BenchmarkMistral Largeo1-mini
LMArena Non-English12371289
LMArena Chinese12401314
LMArena French13251293
LMArena German12541278
LMArena Japanese11881245
LMArena Korean12021223
LMArena Russian12571283
LMArena Spanish12681303

Instruction Following Mistral Large leads

Mistral Large: 67.9 (#191), o1-mini: 66.7 (#206)

Instruction Following benchmarks
BenchmarkMistral Largeo1-mini
LiveBench Instruction Following67.9%65.4%
LMArena Instruction Following12491304
IFEval87.7%—

Long Context o1-mini leads

Mistral Large: 38.3 (#199), o1-mini: 40.1 (#161)

Long Context benchmarks
BenchmarkMistral Largeo1-mini
LMArena Longer Query12611320

Writing & Preference o1-mini leads

Mistral Large: 40.7 (#242), o1-mini: 48.4 (#202)

Writing & Preference benchmarks
BenchmarkMistral Largeo1-mini
LMArena Text12661317
LMArena Creative Writing12431244
Short-Story Creative Writing69%64.9%
LMArena Multi-Turn12601314
LiveBench Language39.4%40.9%
EQ-Bench Creative Writing985—
WildBench80.1%—

Frequently asked questions

Is Mistral Large better than o1-mini?

o1-mini is the stronger model overall, scoring 34.0 to 31.9 on the Noometry Index.

Is Mistral Large or o1-mini better for coding?

o1-mini scores higher on coding benchmarks: 35.5 versus 34.3 in the Noometry coding category.

How many benchmarks do Mistral Large and o1-mini share?

34 benchmarks have published results for both models. Mistral Large has 51 scored results on Noometry and o1-mini has 39.

Related comparisons

Go deeper