Model comparison

Amazon Nova Experimental Chat 10 20 vs DeepSeek-V3.1

Amazon Nova Experimental Chat 10 20 and DeepSeek-V3.1 score almost the same on the Noometry Index (42.1 vs 42.8), so choose on price, context window or the category you care about most.

Last verified . 17 shared benchmarks.

DeepSeek-V3.1 DeepSeek

42.8

Rank #108 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Amazon Nova Experimental Chat 10 20 scores higher in 4 categories and DeepSeek-V3.1 in 4 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in long context, where Amazon Nova Experimental Chat 10 20 leads 41.7 to 36.3.
  • DeepSeek-V3.1 has downloadable open weights; the other is API-only.

Side by side

Amazon Nova Experimental Chat 10 20 and DeepSeek-V3.1 specifications
Amazon Nova Experimental Chat 10 20DeepSeek-V3.1
ProviderAmazonDeepSeek
Noometry Index42.142.8
Released—2025-08-21
WeightsProprietaryOpen
Context window—164K
Max output—8K
Input $ / M tokens—$0.25
Output $ / M tokens—$0.95
Results tracked1727

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Amazon Nova Experimental Chat 10 20 leads

Amazon Nova Experimental Chat 10 20: 41.6 (#123), DeepSeek-V3.1: 40.3 (#144)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20DeepSeek-V3.1
LMArena Coding14121417
WeirdML—38.4%

Reasoning Too close to call

Amazon Nova Experimental Chat 10 20: 28.4 (#106), DeepSeek-V3.1: 27.9 (#110)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20DeepSeek-V3.1
LMArena Hard Prompts13961417
SimpleBench—40%
Kagi LLM Benchmark—53.2%
DTBench—82.7%
LMCA—24.3%
Epoch Capabilities Index—139.92
ForecastBench—58

Math Too close to call

Amazon Nova Experimental Chat 10 20: 39.0 (#119), DeepSeek-V3.1: 38.9 (#122)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20DeepSeek-V3.1
LMArena Math14251420

Knowledge DeepSeek-V3.1 leads

Amazon Nova Experimental Chat 10 20: 38.5 (#144), DeepSeek-V3.1: 43.7 (#90)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20DeepSeek-V3.1
LMArena Expert13861405
Vectara Hallucination Rate—5.5%

Multilingual DeepSeek-V3.1 leads

Amazon Nova Experimental Chat 10 20: 49.5 (#131), DeepSeek-V3.1: 51.6 (#106)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20DeepSeek-V3.1
LMArena Non-English13721400
LMArena Chinese14041469
LMArena French14251447
LMArena German13911411
LMArena Japanese13601378
LMArena Korean13241337
LMArena Russian13711405
LMArena Spanish13821431

Instruction Following DeepSeek-V3.1 leads

Amazon Nova Experimental Chat 10 20: 72.1 (#141), DeepSeek-V3.1: 73.9 (#110)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20DeepSeek-V3.1
LMArena Instruction Following13651400

Long Context Amazon Nova Experimental Chat 10 20 leads

Amazon Nova Experimental Chat 10 20: 41.7 (#133), DeepSeek-V3.1: 36.3 (#232)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20DeepSeek-V3.1
LMArena Longer Query13701422
Fiction.LiveBench—52.8%

Writing & Preference DeepSeek-V3.1 leads

Amazon Nova Experimental Chat 10 20: 56.6 (#136), DeepSeek-V3.1: 60.3 (#98)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 10 20DeepSeek-V3.1
LMArena Text13941420
LMArena Creative Writing13181401
LMArena Multi-Turn13641408
EQ-Bench Creative Writing—1436

Frequently asked questions

Is Amazon Nova Experimental Chat 10 20 better than DeepSeek-V3.1?

Amazon Nova Experimental Chat 10 20 and DeepSeek-V3.1 score almost the same on the Noometry Index (42.1 vs 42.8), so choose on price, context window or the category you care about most.

Is Amazon Nova Experimental Chat 10 20 or DeepSeek-V3.1 better for coding?

Amazon Nova Experimental Chat 10 20 scores higher on coding benchmarks: 41.6 versus 40.3 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 10 20 and DeepSeek-V3.1 share?

17 benchmarks have published results for both models. Amazon Nova Experimental Chat 10 20 has 17 scored results on Noometry and DeepSeek-V3.1 has 27.

Related comparisons

Go deeper