Model comparison

Amazon Nova Micro vs Llama 3-8B

Amazon Nova Micro is the stronger model overall, scoring 30.4 to 25.5 on the Noometry Index.

Last verified . 18 shared benchmarks.

Amazon Nova Micro Amazon

30.4

Rank #294 Confirmed

Llama 3-8B Meta

25.5

Rank #344 Confirmed

Summary

  • They share 18 benchmarks with published results for both. Amazon Nova Micro scores higher in 6 categories and Llama 3-8B in 2 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Amazon Nova Micro leads 29.6 to 7.8.
  • Llama 3-8B has downloadable open weights; the other is API-only.

Side by side

Amazon Nova Micro and Llama 3-8B specifications
Amazon Nova MicroLlama 3-8B
ProviderAmazonMeta
Noometry Index30.425.5
Released2024-12-032024-04-18
WeightsProprietaryOpen
Context window128K—
Max output10K—
Input $ / M tokens$0.035—
Output $ / M tokens$0.14—
Results tracked3234

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

Amazon Nova Micro: 30.5 (#295), Llama 3-8B: 31.0 (#289)

Coding benchmarks
BenchmarkAmazon Nova MicroLlama 3-8B
LMArena Coding12181152
BigCodeBench Instruct—31.9%
LiveBench Coding20.2%—
BigCodeBench Complete—36.9%
HumanEval+—56.7%
MBPP+—54.8%

Agentic & Tool Use Not comparable

Amazon Nova Micro: 22.1 (#132), Llama 3-8B: —

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova MicroLlama 3-8B
Berkeley Function Calling Leaderboard22.3%—

Reasoning Amazon Nova Micro leads

Amazon Nova Micro: 17.4 (#294), Llama 3-8B: 14.3 (#326)

Reasoning benchmarks
BenchmarkAmazon Nova MicroLlama 3-8B
LMArena Hard Prompts11911133
Chess Puzzles—0%
LiveBench Reasoning25.1%—
DTBench—43.9%
LiveBench Data Analysis34%—
Adversarial NLI—57.3%
Epoch Capabilities Index—116.45
ForecastBench—58.6
LiveBench29.6%—
WinoGrande—75.7%

Math Amazon Nova Micro leads

Amazon Nova Micro: 26.9 (#254), Llama 3-8B: 8.8 (#323)

Math benchmarks
BenchmarkAmazon Nova MicroLlama 3-8B
LMArena Math12061151
OTIS Mock AIME 2024-2025—1.9%
Omni-MATH21.4%—
LiveBench Math34.5%—
MATH Level 5—6.1%

Knowledge Amazon Nova Micro leads

Amazon Nova Micro: 29.6 (#237), Llama 3-8B: 7.8 (#308)

Knowledge benchmarks
BenchmarkAmazon Nova MicroLlama 3-8B
LMArena Expert11841113
MMLU70.8%68.8%
GPQA Diamond—26.1%
MMLU-Pro51.1%—
Vectara Hallucination Rate5.5%—
GPQA (HELM)38.3%—
ARC (AI2) Challenge—82.8%
OpenBookQA—82.6%
TriviaQA—67.7%

Multilingual Amazon Nova Micro leads

Amazon Nova Micro: 36.5 (#239), Llama 3-8B: 30.8 (#261)

Multilingual benchmarks
BenchmarkAmazon Nova MicroLlama 3-8B
LMArena Non-English11861098
LMArena Chinese12091076
LMArena French12381159
LMArena German11921104
LMArena Japanese1154967
LMArena Korean11501004
LMArena Russian11851109
LMArena Spanish12251173

Instruction Following Llama 3-8B leads

Amazon Nova Micro: 56.3 (#272), Llama 3-8B: 58.4 (#260)

Instruction Following benchmarks
BenchmarkAmazon Nova MicroLlama 3-8B
LMArena Instruction Following11741127
LiveBench Instruction Following48%—
IFEval76%—

Long Context Amazon Nova Micro leads

Amazon Nova Micro: 36.5 (#229), Llama 3-8B: 34.2 (#251)

Long Context benchmarks
BenchmarkAmazon Nova MicroLlama 3-8B
LMArena Longer Query12051128

Writing & Preference Amazon Nova Micro leads

Amazon Nova Micro: 39.5 (#247), Llama 3-8B: 37.5 (#256)

Writing & Preference benchmarks
BenchmarkAmazon Nova MicroLlama 3-8B
LMArena Text12081166
LMArena Creative Writing11721150
LMArena Multi-Turn11781152
WildBench74.3%—
LiveBench Language15.8%—

Frequently asked questions

Is Amazon Nova Micro better than Llama 3-8B?

Amazon Nova Micro is the stronger model overall, scoring 30.4 to 25.5 on the Noometry Index.

Is Amazon Nova Micro or Llama 3-8B better for coding?

They score almost the same on coding (30.5 vs 31.0); test both on your own repository before choosing.

How many benchmarks do Amazon Nova Micro and Llama 3-8B share?

18 benchmarks have published results for both models. Amazon Nova Micro has 32 scored results on Noometry and Llama 3-8B has 34.

Related comparisons

Go deeper