Model comparison

Amazon Nova Experimental Chat 26 01 10 vs OLMo 2 Furious 13B

Amazon Nova Experimental Chat 26 01 10 is the stronger model overall, scoring 42.8 to 29.7 on the Noometry Index.

Last verified . 0 shared benchmarks.

Summary

  • The widest gap is in knowledge, where Amazon Nova Experimental Chat 26 01 10 leads 40.3 to 18.3.
  • OLMo 2 Furious 13B has downloadable open weights; the other is API-only.

Side by side

Amazon Nova Experimental Chat 26 01 10 and OLMo 2 Furious 13B specifications
Amazon Nova Experimental Chat 26 01 10OLMo 2 Furious 13B
ProviderAmazonAllen Institute for AI (Ai2)
Noometry Index42.829.7
Released—2024-12-31
WeightsProprietaryOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1312

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Amazon Nova Experimental Chat 26 01 10 leads

Amazon Nova Experimental Chat 26 01 10: 42.7 (#96), OLMo 2 Furious 13B: 28.6 (#313)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10OLMo 2 Furious 13B
LiveBench Coding—10.4%
LMArena Coding1447—

Reasoning Amazon Nova Experimental Chat 26 01 10 leads

Amazon Nova Experimental Chat 26 01 10: 28.9 (#98), OLMo 2 Furious 13B: 15.5 (#314)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10OLMo 2 Furious 13B
LiveBench Reasoning—16.3%
LMArena Hard Prompts1415—
LiveBench Data Analysis—20.6%
LiveBench—22.1%

Math Amazon Nova Experimental Chat 26 01 10 leads

Amazon Nova Experimental Chat 26 01 10: 38.5 (#136), OLMo 2 Furious 13B: 23.1 (#273)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10OLMo 2 Furious 13B
Omni-MATH—15.6%
LiveBench Math—13.6%
LMArena Math1404—

Knowledge Amazon Nova Experimental Chat 26 01 10 leads

Amazon Nova Experimental Chat 26 01 10: 40.3 (#120), OLMo 2 Furious 13B: 18.3 (#283)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10OLMo 2 Furious 13B
MMLU-Pro—31%
GPQA (HELM)—31.6%
LMArena Expert1444—

Multilingual Not comparable

Amazon Nova Experimental Chat 26 01 10: 50.2 (#126), OLMo 2 Furious 13B: —

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10OLMo 2 Furious 13B
LMArena Non-English1381—
LMArena Chinese1372—
LMArena Russian1391—
LMArena Spanish1390—

Instruction Following Amazon Nova Experimental Chat 26 01 10 leads

Amazon Nova Experimental Chat 26 01 10: 72.9 (#126), OLMo 2 Furious 13B: 60.9 (#248)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10OLMo 2 Furious 13B
LiveBench Instruction Following—60.6%
IFEval—73%
LMArena Instruction Following1381—

Long Context Not comparable

Amazon Nova Experimental Chat 26 01 10: 42.7 (#119), OLMo 2 Furious 13B: —

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10OLMo 2 Furious 13B
LMArena Longer Query1400—

Writing & Preference Amazon Nova Experimental Chat 26 01 10 leads

Amazon Nova Experimental Chat 26 01 10: 57.4 (#129), OLMo 2 Furious 13B: 42.9 (#230)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 26 01 10OLMo 2 Furious 13B
LMArena Text1396—
LMArena Creative Writing1331—
WildBench—68.9%
LMArena Multi-Turn1380—
LiveBench Language—11.2%

Frequently asked questions

Is Amazon Nova Experimental Chat 26 01 10 better than OLMo 2 Furious 13B?

Amazon Nova Experimental Chat 26 01 10 is the stronger model overall, scoring 42.8 to 29.7 on the Noometry Index.

Is Amazon Nova Experimental Chat 26 01 10 or OLMo 2 Furious 13B better for coding?

Amazon Nova Experimental Chat 26 01 10 scores higher on coding benchmarks: 42.7 versus 28.6 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 26 01 10 and OLMo 2 Furious 13B share?

0 benchmarks have published results for both models. Amazon Nova Experimental Chat 26 01 10 has 13 scored results on Noometry and OLMo 2 Furious 13B has 12.

Related comparisons

Go deeper