Model comparison

DeepSeek-V3.1-Terminus vs OLMo 2 Furious 13B

DeepSeek-V3.1-Terminus is the stronger model overall, scoring 43.1 to 29.7 on the Noometry Index.

Last verified . 0 shared benchmarks.

Summary

  • The widest gap is in writing & preference, where DeepSeek-V3.1-Terminus leads 61.0 to 42.9.

Side by side

DeepSeek-V3.1-Terminus and OLMo 2 Furious 13B specifications
DeepSeek-V3.1-TerminusOLMo 2 Furious 13B
ProviderDeepSeekAllen Institute for AI (Ai2)
Noometry Index43.129.7
Released2025-09-222024-12-31
WeightsOpenOpen
Context window164K—
Max output147K—
Input $ / M tokens$0.27—
Output $ / M tokens$1—
Results tracked1612

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding DeepSeek-V3.1-Terminus leads

DeepSeek-V3.1-Terminus: 42.0 (#113), OLMo 2 Furious 13B: 28.6 (#313)

Coding benchmarks
BenchmarkDeepSeek-V3.1-TerminusOLMo 2 Furious 13B
SciCode40.6%—
LiveBench Coding—10.4%
LMArena Coding1426—
ALE-Bench745.17—

Reasoning DeepSeek-V3.1-Terminus leads

DeepSeek-V3.1-Terminus: 26.4 (#133), OLMo 2 Furious 13B: 15.5 (#314)

Reasoning benchmarks
BenchmarkDeepSeek-V3.1-TerminusOLMo 2 Furious 13B
Kagi LLM Benchmark57.4%—
CritPt1.7%—
LiveBench Reasoning—16.3%
LMArena Hard Prompts1426—
DTBench81.3%—
LiveBench Data Analysis—20.6%
LMCA28.6%—
LiveBench—22.1%

Math DeepSeek-V3.1-Terminus leads

DeepSeek-V3.1-Terminus: 38.5 (#137), OLMo 2 Furious 13B: 23.1 (#273)

Math benchmarks
BenchmarkDeepSeek-V3.1-TerminusOLMo 2 Furious 13B
Omni-MATH—15.6%
LiveBench Math—13.6%
LMArena Math1402—

Knowledge Not comparable

DeepSeek-V3.1-Terminus: —, OLMo 2 Furious 13B: 18.3 (#283)

Knowledge benchmarks
BenchmarkDeepSeek-V3.1-TerminusOLMo 2 Furious 13B
MMLU-Pro—31%
GPQA (HELM)—31.6%

Multilingual Not comparable

DeepSeek-V3.1-Terminus: 52.1 (#92), OLMo 2 Furious 13B: —

Multilingual benchmarks
BenchmarkDeepSeek-V3.1-TerminusOLMo 2 Furious 13B
LMArena Non-English1407—
LMArena Russian1436—

Instruction Following DeepSeek-V3.1-Terminus leads

DeepSeek-V3.1-Terminus: 74.0 (#106), OLMo 2 Furious 13B: 60.9 (#248)

Instruction Following benchmarks
BenchmarkDeepSeek-V3.1-TerminusOLMo 2 Furious 13B
LiveBench Instruction Following—60.6%
IFEval—73%
LMArena Instruction Following1404—

Long Context Not comparable

DeepSeek-V3.1-Terminus: 43.4 (#97), OLMo 2 Furious 13B: —

Long Context benchmarks
BenchmarkDeepSeek-V3.1-TerminusOLMo 2 Furious 13B
LMArena Longer Query1421—

Writing & Preference DeepSeek-V3.1-Terminus leads

DeepSeek-V3.1-Terminus: 61.0 (#92), OLMo 2 Furious 13B: 42.9 (#230)

Writing & Preference benchmarks
BenchmarkDeepSeek-V3.1-TerminusOLMo 2 Furious 13B
LMArena Text1419—
LMArena Creative Writing1403—
WildBench—68.9%
LMArena Multi-Turn1411—
LiveBench Language—11.2%

Frequently asked questions

Is DeepSeek-V3.1-Terminus better than OLMo 2 Furious 13B?

DeepSeek-V3.1-Terminus is the stronger model overall, scoring 43.1 to 29.7 on the Noometry Index.

Is DeepSeek-V3.1-Terminus or OLMo 2 Furious 13B better for coding?

DeepSeek-V3.1-Terminus scores higher on coding benchmarks: 42.0 versus 28.6 in the Noometry coding category.

How many benchmarks do DeepSeek-V3.1-Terminus and OLMo 2 Furious 13B share?

0 benchmarks have published results for both models. DeepSeek-V3.1-Terminus has 16 scored results on Noometry and OLMo 2 Furious 13B has 12.

Related comparisons

Go deeper