Model comparison

Amazon Nova Experimental Chat 26 02 10 vs OLMo 2 Furious 13B

Amazon Nova Experimental Chat 26 02 10 is the stronger model overall, scoring 44.5 to 29.7 on the Noometry Index.

Last verified . 0 shared benchmarks.

Summary

  • The widest gap is in knowledge, where Amazon Nova Experimental Chat 26 02 10 leads 42.3 to 18.3.
  • OLMo 2 Furious 13B has downloadable open weights; the other is API-only.

Side by side

Amazon Nova Experimental Chat 26 02 10 and OLMo 2 Furious 13B specifications
Amazon Nova Experimental Chat 26 02 10OLMo 2 Furious 13B
ProviderAmazonAllen Institute for AI (Ai2)
Noometry Index44.529.7
Released—2024-12-31
WeightsProprietaryOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1212

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 43.9 (#82), OLMo 2 Furious 13B: 28.6 (#313)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10OLMo 2 Furious 13B
LiveBench Coding—10.4%
LMArena Coding1483—

Reasoning Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 30.1 (#86), OLMo 2 Furious 13B: 15.5 (#314)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10OLMo 2 Furious 13B
LiveBench Reasoning—16.3%
LMArena Hard Prompts1458—
LiveBench Data Analysis—20.6%
LiveBench—22.1%

Math Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 39.3 (#109), OLMo 2 Furious 13B: 23.1 (#273)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10OLMo 2 Furious 13B
Omni-MATH—15.6%
LiveBench Math—13.6%
LMArena Math1438—

Knowledge Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 42.3 (#97), OLMo 2 Furious 13B: 18.3 (#283)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10OLMo 2 Furious 13B
MMLU-Pro—31%
GPQA (HELM)—31.6%
LMArena Expert1506—

Multilingual Not comparable

Amazon Nova Experimental Chat 26 02 10: 54.0 (#50), OLMo 2 Furious 13B: —

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10OLMo 2 Furious 13B
LMArena Non-English1434—
LMArena Chinese1463—
LMArena Russian1423—

Instruction Following Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 75.2 (#69), OLMo 2 Furious 13B: 60.9 (#248)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10OLMo 2 Furious 13B
LiveBench Instruction Following—60.6%
IFEval—73%
LMArena Instruction Following1427—

Long Context Not comparable

Amazon Nova Experimental Chat 26 02 10: 44.0 (#77), OLMo 2 Furious 13B: —

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10OLMo 2 Furious 13B
LMArena Longer Query1441—

Writing & Preference Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 61.8 (#84), OLMo 2 Furious 13B: 42.9 (#230)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10OLMo 2 Furious 13B
LMArena Text1448—
LMArena Creative Writing1368—
WildBench—68.9%
LMArena Multi-Turn1442—
LiveBench Language—11.2%

Frequently asked questions

Is Amazon Nova Experimental Chat 26 02 10 better than OLMo 2 Furious 13B?

Amazon Nova Experimental Chat 26 02 10 is the stronger model overall, scoring 44.5 to 29.7 on the Noometry Index.

Is Amazon Nova Experimental Chat 26 02 10 or OLMo 2 Furious 13B better for coding?

Amazon Nova Experimental Chat 26 02 10 scores higher on coding benchmarks: 43.9 versus 28.6 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 26 02 10 and OLMo 2 Furious 13B share?

0 benchmarks have published results for both models. Amazon Nova Experimental Chat 26 02 10 has 12 scored results on Noometry and OLMo 2 Furious 13B has 12.

Related comparisons

Go deeper