Model comparison

Trinity Large Thinking vs Wizardlm 70b

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 33.0 on the Noometry Index.

Last verified . 12 shared benchmarks.

Trinity Large Thinking Arcee AI

38.6

Rank #185 Confirmed

Wizardlm 70b Microsoft

33.0

Rank #249 Confirmed

Summary

  • They share 12 benchmarks with published results for both. Trinity Large Thinking scores higher in 6 categories and Wizardlm 70b in 1 category; 7 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Trinity Large Thinking leads 53.8 to 34.8.

Side by side

Trinity Large Thinking and Wizardlm 70b specifications
Trinity Large ThinkingWizardlm 70b
ProviderArcee AIMicrosoft
Noometry Index38.633.0
Released2026-04-01—
WeightsOpenOpen
Context window262K—
Max output80K—
Input $ / M tokens$0.25—
Output $ / M tokens$0.80—
Results tracked2412

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Trinity Large Thinking leads

Trinity Large Thinking: 34.1 (#244), Wizardlm 70b: 31.4 (#285)

Coding benchmarks
BenchmarkTrinity Large ThinkingWizardlm 70b
LMArena Coding13811081
LMArena WebDev1238—
SciCode36.1%—

Reasoning Wizardlm 70b leads

Trinity Large Thinking: 16.9 (#298), Wizardlm 70b: 20.7 (#234)

Reasoning benchmarks
BenchmarkTrinity Large ThinkingWizardlm 70b
LMArena Hard Prompts13501079
NYT Connections (extended)16.5%—
CritPt0.9%—
Thematic Generalization41.6%—
Surface Evolver Bench15.6%—

Math Trinity Large Thinking leads

Trinity Large Thinking: 37.6 (#149), Wizardlm 70b: 32.2 (#218)

Math benchmarks
BenchmarkTrinity Large ThinkingWizardlm 70b
LMArena Math13661116

Knowledge Not comparable

Trinity Large Thinking: 40.9 (#113), Wizardlm 70b: —

Knowledge benchmarks
BenchmarkTrinity Large ThinkingWizardlm 70b
Vectara Hallucination Rate6.9%—
LMArena Expert1360—

Multilingual Trinity Large Thinking leads

Trinity Large Thinking: 46.2 (#160), Wizardlm 70b: 29.6 (#265)

Multilingual benchmarks
BenchmarkTrinity Large ThinkingWizardlm 70b
LMArena Non-English13251078
LMArena Chinese13731052
LMArena German13561083
LMArena Russian13371155
LMArena French1374—
LMArena Japanese1311—
LMArena Korean1306—
LMArena Spanish1357—

Instruction Following Trinity Large Thinking leads

Trinity Large Thinking: 70.5 (#162), Wizardlm 70b: 56.3 (#273)

Instruction Following benchmarks
BenchmarkTrinity Large ThinkingWizardlm 70b
LMArena Instruction Following13341093

Long Context Trinity Large Thinking leads

Trinity Large Thinking: 41.3 (#144), Wizardlm 70b: 33.3 (#263)

Long Context benchmarks
BenchmarkTrinity Large ThinkingWizardlm 70b
LMArena Longer Query13551097

Writing & Preference Trinity Large Thinking leads

Trinity Large Thinking: 53.8 (#158), Wizardlm 70b: 34.8 (#269)

Writing & Preference benchmarks
BenchmarkTrinity Large ThinkingWizardlm 70b
LMArena Text13401120
LMArena Creative Writing13201149
LMArena Multi-Turn13421108

Frequently asked questions

Is Trinity Large Thinking better than Wizardlm 70b?

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 33.0 on the Noometry Index.

Is Trinity Large Thinking or Wizardlm 70b better for coding?

Trinity Large Thinking scores higher on coding benchmarks: 34.1 versus 31.4 in the Noometry coding category.

How many benchmarks do Trinity Large Thinking and Wizardlm 70b share?

12 benchmarks have published results for both models. Trinity Large Thinking has 24 scored results on Noometry and Wizardlm 70b has 12.

Related comparisons

Go deeper