Model comparison

Trinity Large Thinking vs Wizardlm 13b

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 31.4 on the Noometry Index.

Last verified . 10 shared benchmarks.

Trinity Large Thinking Arcee AI

38.6

Rank #185 Confirmed

Wizardlm 13b Microsoft

31.4

Rank #274 Confirmed

Summary

  • They share 10 benchmarks with published results for both. Trinity Large Thinking scores higher in 6 categories and Wizardlm 13b in 1 category; 7 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Trinity Large Thinking leads 53.8 to 30.5.

Side by side

Trinity Large Thinking and Wizardlm 13b specifications
Trinity Large ThinkingWizardlm 13b
ProviderArcee AIMicrosoft
Noometry Index38.631.4
Released2026-04-01—
WeightsOpenOpen
Context window262K—
Max output80K—
Input $ / M tokens$0.25—
Output $ / M tokens$0.80—
Results tracked2410

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Trinity Large Thinking leads

Trinity Large Thinking: 34.1 (#244), Wizardlm 13b: 30.1 (#298)

Coding benchmarks
BenchmarkTrinity Large ThinkingWizardlm 13b
LMArena Coding13811035
LMArena WebDev1238—
SciCode36.1%—

Reasoning Wizardlm 13b leads

Trinity Large Thinking: 16.9 (#298), Wizardlm 13b: 19.4 (#259)

Reasoning benchmarks
BenchmarkTrinity Large ThinkingWizardlm 13b
LMArena Hard Prompts13501018
NYT Connections (extended)16.5%—
CritPt0.9%—
Thematic Generalization41.6%—
Surface Evolver Bench15.6%—

Math Trinity Large Thinking leads

Trinity Large Thinking: 37.6 (#149), Wizardlm 13b: 30.2 (#238)

Math benchmarks
BenchmarkTrinity Large ThinkingWizardlm 13b
LMArena Math13661017

Knowledge Not comparable

Trinity Large Thinking: 40.9 (#113), Wizardlm 13b: —

Knowledge benchmarks
BenchmarkTrinity Large ThinkingWizardlm 13b
Vectara Hallucination Rate6.9%—
LMArena Expert1360—

Multilingual Trinity Large Thinking leads

Trinity Large Thinking: 46.2 (#160), Wizardlm 13b: 27.1 (#277)

Multilingual benchmarks
BenchmarkTrinity Large ThinkingWizardlm 13b
LMArena Non-English13251034
LMArena Chinese13731023
LMArena French1374—
LMArena German1356—
LMArena Japanese1311—
LMArena Korean1306—
LMArena Russian1337—
LMArena Spanish1357—

Instruction Following Trinity Large Thinking leads

Trinity Large Thinking: 70.5 (#162), Wizardlm 13b: 53.5 (#285)

Instruction Following benchmarks
BenchmarkTrinity Large ThinkingWizardlm 13b
LMArena Instruction Following13341048

Long Context Trinity Large Thinking leads

Trinity Large Thinking: 41.3 (#144), Wizardlm 13b: 32.0 (#273)

Long Context benchmarks
BenchmarkTrinity Large ThinkingWizardlm 13b
LMArena Longer Query13551054

Writing & Preference Trinity Large Thinking leads

Trinity Large Thinking: 53.8 (#158), Wizardlm 13b: 30.5 (#287)

Writing & Preference benchmarks
BenchmarkTrinity Large ThinkingWizardlm 13b
LMArena Text13401077
LMArena Creative Writing13201091
LMArena Multi-Turn13421047

Frequently asked questions

Is Trinity Large Thinking better than Wizardlm 13b?

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 31.4 on the Noometry Index.

Is Trinity Large Thinking or Wizardlm 13b better for coding?

Trinity Large Thinking scores higher on coding benchmarks: 34.1 versus 30.1 in the Noometry coding category.

How many benchmarks do Trinity Large Thinking and Wizardlm 13b share?

10 benchmarks have published results for both models. Trinity Large Thinking has 24 scored results on Noometry and Wizardlm 13b has 10.

Related comparisons

Go deeper