Model comparison

Amazon Nova Experimental Chat 26 02 10 vs Llama 3.2 90B

Amazon Nova Experimental Chat 26 02 10 is the stronger model overall, scoring 44.5 to 27.5 on the Noometry Index.

Last verified . 0 shared benchmarks.

Llama 3.2 90B Meta

27.5

Rank #331 Confirmed

Summary

  • The widest gap is in math, where Amazon Nova Experimental Chat 26 02 10 leads 39.3 to 11.1.
  • Llama 3.2 90B has downloadable open weights; the other is API-only.

Side by side

Amazon Nova Experimental Chat 26 02 10 and Llama 3.2 90B specifications
Amazon Nova Experimental Chat 26 02 10Llama 3.2 90B
ProviderAmazonMeta
Noometry Index44.527.5
Released—2024-09-24
WeightsProprietaryOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked129

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Not comparable

Amazon Nova Experimental Chat 26 02 10: 43.9 (#82), Llama 3.2 90B: —

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10Llama 3.2 90B
LMArena Coding1483—

Agentic & Tool Use Not comparable

Amazon Nova Experimental Chat 26 02 10: —, Llama 3.2 90B: 30.0 (#80)

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10Llama 3.2 90B
BALROG—27.3%

Reasoning Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 30.1 (#86), Llama 3.2 90B: 21.7 (#217)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10Llama 3.2 90B
EnigmaEval—0.4%
LMArena Hard Prompts1458—
Epoch Capabilities Index—125.5

Math Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 39.3 (#109), Llama 3.2 90B: 11.1 (#308)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10Llama 3.2 90B
OTIS Mock AIME 2024-2025—2.6%
LMArena Math1438—
MATH Level 5—39.4%

Knowledge Amazon Nova Experimental Chat 26 02 10 leads

Amazon Nova Experimental Chat 26 02 10: 42.3 (#97), Llama 3.2 90B: 21.7 (#274)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10Llama 3.2 90B
GPQA Diamond—41%
LMArena Expert1506—
MMLU—80.3%

Multimodal Not comparable

Amazon Nova Experimental Chat 26 02 10: —, Llama 3.2 90B: 25.4 (#124)

Multimodal benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10Llama 3.2 90B
LMArena Vision—1000
GeoBench—52%

Multilingual Not comparable

Amazon Nova Experimental Chat 26 02 10: 54.0 (#50), Llama 3.2 90B: —

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10Llama 3.2 90B
LMArena Non-English1434—
LMArena Chinese1463—
LMArena Russian1423—

Instruction Following Not comparable

Amazon Nova Experimental Chat 26 02 10: 75.2 (#69), Llama 3.2 90B: —

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10Llama 3.2 90B
LMArena Instruction Following1427—

Long Context Not comparable

Amazon Nova Experimental Chat 26 02 10: 44.0 (#77), Llama 3.2 90B: —

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10Llama 3.2 90B
LMArena Longer Query1441—

Writing & Preference Not comparable

Amazon Nova Experimental Chat 26 02 10: 61.8 (#84), Llama 3.2 90B: —

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 26 02 10Llama 3.2 90B
LMArena Text1448—
LMArena Creative Writing1368—
LMArena Multi-Turn1442—

Frequently asked questions

Is Amazon Nova Experimental Chat 26 02 10 better than Llama 3.2 90B?

Amazon Nova Experimental Chat 26 02 10 is the stronger model overall, scoring 44.5 to 27.5 on the Noometry Index.

How many benchmarks do Amazon Nova Experimental Chat 26 02 10 and Llama 3.2 90B share?

0 benchmarks have published results for both models. Amazon Nova Experimental Chat 26 02 10 has 12 scored results on Noometry and Llama 3.2 90B has 9.

Related comparisons

Go deeper