Model comparison

DBRX vs DeepSeek-V3.1-Terminus

DeepSeek-V3.1-Terminus is the stronger model overall, scoring 43.1 to 29.4 on the Noometry Index.

Last verified . 10 shared benchmarks.

DBRX Databricks

29.4

Rank #311 Confirmed

DeepSeek-V3.1-Terminus DeepSeek

43.1

Rank #97 Confirmed

Summary

  • They share 10 benchmarks with published results for both. DBRX scores higher in 0 categories and DeepSeek-V3.1-Terminus in 7 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where DeepSeek-V3.1-Terminus leads 61.0 to 33.6.

Side by side

DBRX and DeepSeek-V3.1-Terminus specifications
DBRXDeepSeek-V3.1-Terminus
ProviderDatabricksDeepSeek
Noometry Index29.443.1
Released2024-03-272025-09-22
WeightsOpenOpen
Context window—164K
Max output—147K
Input $ / M tokens—$0.27
Output $ / M tokens—$1
Results tracked2116

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding DeepSeek-V3.1-Terminus leads

DBRX: 32.9 (#266), DeepSeek-V3.1-Terminus: 42.0 (#113)

Coding benchmarks
BenchmarkDBRXDeepSeek-V3.1-Terminus
LMArena Coding11321426
SciCode—40.6%
ALE-Bench—745.17
HumanEval+70.1%—
MBPP+55.8%—

Reasoning DeepSeek-V3.1-Terminus leads

DBRX: 21.4 (#222), DeepSeek-V3.1-Terminus: 26.4 (#133)

Reasoning benchmarks
BenchmarkDBRXDeepSeek-V3.1-Terminus
LMArena Hard Prompts11131426
Kagi LLM Benchmark—57.4%
CritPt—1.7%
DTBench—81.3%
LMCA—28.6%

Math DeepSeek-V3.1-Terminus leads

DBRX: 24.3 (#269), DeepSeek-V3.1-Terminus: 38.5 (#137)

Math benchmarks
BenchmarkDBRXDeepSeek-V3.1-Terminus
LMArena Math11451402
MATH Level 511.7%—

Knowledge Not comparable

DBRX: 14.9 (#294), DeepSeek-V3.1-Terminus: —

Knowledge benchmarks
BenchmarkDBRXDeepSeek-V3.1-Terminus
GPQA Diamond32.9%—
LMArena Expert1076—

Multilingual DeepSeek-V3.1-Terminus leads

DBRX: 29.3 (#268), DeepSeek-V3.1-Terminus: 52.1 (#92)

Multilingual benchmarks
BenchmarkDBRXDeepSeek-V3.1-Terminus
LMArena Non-English10711407
LMArena Russian10781436
LMArena Chinese1068—
LMArena French1096—
LMArena German1057—
LMArena Japanese990—
LMArena Korean993—
LMArena Spanish1064—

Instruction Following DeepSeek-V3.1-Terminus leads

DBRX: 57.5 (#270), DeepSeek-V3.1-Terminus: 74.0 (#106)

Instruction Following benchmarks
BenchmarkDBRXDeepSeek-V3.1-Terminus
LMArena Instruction Following11121404

Long Context DeepSeek-V3.1-Terminus leads

DBRX: 33.7 (#258), DeepSeek-V3.1-Terminus: 43.4 (#97)

Long Context benchmarks
BenchmarkDBRXDeepSeek-V3.1-Terminus
LMArena Longer Query11121421

Writing & Preference DeepSeek-V3.1-Terminus leads

DBRX: 33.6 (#275), DeepSeek-V3.1-Terminus: 61.0 (#92)

Writing & Preference benchmarks
BenchmarkDBRXDeepSeek-V3.1-Terminus
LMArena Text11191419
LMArena Creative Writing11041403
LMArena Multi-Turn11111411

Frequently asked questions

Is DBRX better than DeepSeek-V3.1-Terminus?

DeepSeek-V3.1-Terminus is the stronger model overall, scoring 43.1 to 29.4 on the Noometry Index.

Is DBRX or DeepSeek-V3.1-Terminus better for coding?

DeepSeek-V3.1-Terminus scores higher on coding benchmarks: 42.0 versus 32.9 in the Noometry coding category.

How many benchmarks do DBRX and DeepSeek-V3.1-Terminus share?

10 benchmarks have published results for both models. DBRX has 21 scored results on Noometry and DeepSeek-V3.1-Terminus has 16.

Related comparisons

Go deeper