Model comparison

Mercury vs Trinity Large Thinking

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 37.6 on the Noometry Index.

Last verified . 8 shared benchmarks.

Mercury Inception

37.6

Rank #199 Confirmed

Trinity Large Thinking Arcee AI

38.6

Rank #185 Confirmed

Summary

  • They share 8 benchmarks with published results for both. Mercury scores higher in 2 categories and Trinity Large Thinking in 4 categories; 5 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Trinity Large Thinking leads 53.8 to 46.2.
  • Trinity Large Thinking has downloadable open weights; the other is API-only.

Side by side

Mercury and Trinity Large Thinking specifications
MercuryTrinity Large Thinking
ProviderInceptionArcee AI
Noometry Index37.638.6
Released—2026-04-01
WeightsProprietaryOpen
Context window—262K
Max output—80K
Input $ / M tokens—$0.25
Output $ / M tokens—$0.80
Results tracked924

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Mercury leads

Mercury: 38.7 (#170), Trinity Large Thinking: 34.1 (#244)

Coding benchmarks
BenchmarkMercuryTrinity Large Thinking
LMArena Coding13221381
LMArena WebDev—1238
SciCode—36.1%

Reasoning Too close to call

Mercury: 17.5 (#293), Trinity Large Thinking: 16.9 (#298)

Reasoning benchmarks
BenchmarkMercuryTrinity Large Thinking
LMArena Hard Prompts12851350
Kagi LLM Benchmark21.6%—
NYT Connections (extended)—16.5%
CritPt—0.9%
Thematic Generalization—41.6%
Surface Evolver Bench—15.6%

Math Not comparable

Mercury: —, Trinity Large Thinking: 37.6 (#149)

Math benchmarks
BenchmarkMercuryTrinity Large Thinking
LMArena Math—1366

Knowledge Not comparable

Mercury: —, Trinity Large Thinking: 40.9 (#113)

Knowledge benchmarks
BenchmarkMercuryTrinity Large Thinking
Vectara Hallucination Rate—6.9%
LMArena Expert—1360

Multilingual Trinity Large Thinking leads

Mercury: 41.6 (#206), Trinity Large Thinking: 46.2 (#160)

Multilingual benchmarks
BenchmarkMercuryTrinity Large Thinking
LMArena Non-English12601325
LMArena Chinese—1373
LMArena French—1374
LMArena German—1356
LMArena Japanese—1311
LMArena Korean—1306
LMArena Russian—1337
LMArena Spanish—1357

Instruction Following Trinity Large Thinking leads

Mercury: 65.2 (#224), Trinity Large Thinking: 70.5 (#162)

Instruction Following benchmarks
BenchmarkMercuryTrinity Large Thinking
LMArena Instruction Following12391334

Long Context Trinity Large Thinking leads

Mercury: 38.4 (#198), Trinity Large Thinking: 41.3 (#144)

Long Context benchmarks
BenchmarkMercuryTrinity Large Thinking
LMArena Longer Query12661355

Writing & Preference Trinity Large Thinking leads

Mercury: 46.2 (#221), Trinity Large Thinking: 53.8 (#158)

Writing & Preference benchmarks
BenchmarkMercuryTrinity Large Thinking
LMArena Text12821340
LMArena Creative Writing11911320
LMArena Multi-Turn12821342

Frequently asked questions

Is Mercury better than Trinity Large Thinking?

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 37.6 on the Noometry Index.

Is Mercury or Trinity Large Thinking better for coding?

Mercury scores higher on coding benchmarks: 38.7 versus 34.1 in the Noometry coding category.

How many benchmarks do Mercury and Trinity Large Thinking share?

8 benchmarks have published results for both models. Mercury has 9 scored results on Noometry and Trinity Large Thinking has 24.

Related comparisons

Go deeper