Model comparison

Claude 3.5 Sonnet vs Trinity Large Thinking

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 34.6 on the Noometry Index.

Last verified . 17 shared benchmarks.

Claude 3.5 Sonnet Anthropic

34.6

Rank #231 Confirmed

Trinity Large Thinking Arcee AI

38.6

Rank #185 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Claude 3.5 Sonnet scores higher in 2 categories and Trinity Large Thinking in 6 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in math, where Trinity Large Thinking leads 37.6 to 19.2.
  • Trinity Large Thinking has downloadable open weights; the other is API-only.

Side by side

Claude 3.5 Sonnet and Trinity Large Thinking specifications
Claude 3.5 SonnetTrinity Large Thinking
ProviderAnthropicArcee AI
Noometry Index34.638.6
Released2024-06-202026-04-01
WeightsProprietaryOpen
Context window—262K
Max output—80K
Input $ / M tokens—$0.25
Output $ / M tokens—$0.80
Results tracked6024

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 39.0 (#165), Trinity Large Thinking: 34.1 (#244)

Coding benchmarks
BenchmarkClaude 3.5 SonnetTrinity Large Thinking
LMArena Coding13421381
Aider Polyglot51.6%—
LMArena WebDev—1238
SciCode—36.1%
GSO4.6%—
WeirdML40%—
BigCodeBench Instruct46.8%—
LiveBench Coding67.1%—
BigCodeBench Complete58.6%—
CadEval48%—
HumanEval+81.7%—
MBPP+74.3%—

Agentic & Tool Use Not comparable

Claude 3.5 Sonnet: 32.3 (#67), Trinity Large Thinking: —

Agentic & Tool Use benchmarks
BenchmarkClaude 3.5 SonnetTrinity Large Thinking
TheAgentCompany24%—
Cybench17.5%—
BALROG32.6%—
METR Time Horizons45.2%—

Reasoning Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 23.1 (#183), Trinity Large Thinking: 16.9 (#298)

Reasoning benchmarks
BenchmarkClaude 3.5 SonnetTrinity Large Thinking
LMArena Hard Prompts13051350
SimpleBench41.4%—
NYT Connections (extended)—16.5%
CritPt—0.9%
EnigmaEval0.9%—
Thematic Generalization—41.6%
LiveBench Reasoning56.7%—
DTBench67.8%—
LiveBench Data Analysis55%—
Surface Evolver Bench—15.6%
Epoch Capabilities Index133.55—
ForecastBench60.7—
LiveBench59%—

Math Trinity Large Thinking leads

Claude 3.5 Sonnet: 19.2 (#288), Trinity Large Thinking: 37.6 (#149)

Math benchmarks
BenchmarkClaude 3.5 SonnetTrinity Large Thinking
LMArena Math13071366
OTIS Mock AIME 2024-20258.5%—
Omni-MATH27.6%—
LiveBench Math52.3%—
MATH Level 556.9%—
FrontierMath (Feb 2025 set)2.1%—
FrontierMath Tier 4 (v1)0%—

Knowledge Trinity Large Thinking leads

Claude 3.5 Sonnet: 28.6 (#245), Trinity Large Thinking: 40.9 (#113)

Knowledge benchmarks
BenchmarkClaude 3.5 SonnetTrinity Large Thinking
LMArena Expert12651360
GPQA Diamond55.3%—
Humanity's Last Exam4.1%—
MMLU-Pro77.7%—
Confabulations19.9%—
Vectara Hallucination Rate—6.9%
GPQA (HELM)56.5%—
MMLU87.3%—

Multimodal Not comparable

Claude 3.5 Sonnet: 26.5 (#120), Trinity Large Thinking: —

Multimodal benchmarks
BenchmarkClaude 3.5 SonnetTrinity Large Thinking
LMArena Vision1125—
Video-MME60%—
GeoBench62%—
VPCT33%—

Multilingual Trinity Large Thinking leads

Claude 3.5 Sonnet: 43.2 (#185), Trinity Large Thinking: 46.2 (#160)

Multilingual benchmarks
BenchmarkClaude 3.5 SonnetTrinity Large Thinking
LMArena Non-English12831325
LMArena Chinese12721373
LMArena French13051374
LMArena German12971356
LMArena Japanese12341311
LMArena Korean12001306
LMArena Russian13061337
LMArena Spanish12901357

Instruction Following Trinity Large Thinking leads

Claude 3.5 Sonnet: 68.8 (#182), Trinity Large Thinking: 70.5 (#162)

Instruction Following benchmarks
BenchmarkClaude 3.5 SonnetTrinity Large Thinking
LMArena Instruction Following12971334
LiveBench Instruction Following69.3%—
IFEval85.5%—

Long Context Trinity Large Thinking leads

Claude 3.5 Sonnet: 39.9 (#167), Trinity Large Thinking: 41.3 (#144)

Long Context benchmarks
BenchmarkClaude 3.5 SonnetTrinity Large Thinking
LMArena Longer Query13111355

Writing & Preference Too close to call

Claude 3.5 Sonnet: 52.9 (#164), Trinity Large Thinking: 53.8 (#158)

Writing & Preference benchmarks
BenchmarkClaude 3.5 SonnetTrinity Large Thinking
LMArena Text12981340
LMArena Creative Writing12921320
LMArena Multi-Turn13261342
Short-Story Creative Writing80.3%—
EQ-Bench Creative Writing1451—
WildBench79.2%—
LiveBench Language53.8%—

Frequently asked questions

Is Claude 3.5 Sonnet better than Trinity Large Thinking?

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 34.6 on the Noometry Index.

Is Claude 3.5 Sonnet or Trinity Large Thinking better for coding?

Claude 3.5 Sonnet scores higher on coding benchmarks: 39.0 versus 34.1 in the Noometry coding category.

How many benchmarks do Claude 3.5 Sonnet and Trinity Large Thinking share?

17 benchmarks have published results for both models. Claude 3.5 Sonnet has 60 scored results on Noometry and Trinity Large Thinking has 24.

Related comparisons

Go deeper