Model comparison

Claude 3 Sonnet vs Llama 3-8B

Claude 3 Sonnet is the stronger model overall, scoring 29.0 to 25.5 on the Noometry Index.

Last verified . 28 shared benchmarks.

Claude 3 Sonnet Anthropic

29.0

Rank #319 Confirmed

Llama 3-8B Meta

25.5

Rank #344 Confirmed

Summary

  • They share 28 benchmarks with published results for both. Claude 3 Sonnet scores higher in 7 categories and Llama 3-8B in 1 category; 8 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Claude 3 Sonnet leads 21.1 to 7.8.
  • The biggest single-benchmark swing is BigCodeBench Complete: 53.8% for Claude 3 Sonnet and 36.9% for Llama 3-8B.
  • Llama 3-8B has downloadable open weights; the other is API-only.

Side by side

Claude 3 Sonnet and Llama 3-8B specifications
Claude 3 SonnetLlama 3-8B
ProviderAnthropicMeta
Noometry Index29.025.5
Released2024-02-292024-04-18
WeightsProprietaryOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked3034

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Llama 3-8B leads

Claude 3 Sonnet: 29.6 (#302), Llama 3-8B: 31.0 (#289)

Coding benchmarks
BenchmarkClaude 3 SonnetLlama 3-8B
BigCodeBench Instruct42.7%31.9%
LMArena Coding12231152
BigCodeBench Complete53.8%36.9%
HumanEval+64%56.7%
MBPP+69.3%54.8%
WeirdML10.2%—

Reasoning Claude 3 Sonnet leads

Claude 3 Sonnet: 20.5 (#237), Llama 3-8B: 14.3 (#326)

Reasoning benchmarks
BenchmarkClaude 3 SonnetLlama 3-8B
LMArena Hard Prompts11971133
DTBench53.6%43.9%
Epoch Capabilities Index120.7116.45
WinoGrande75.1%75.7%
Chess Puzzles—0%
Adversarial NLI—57.3%
ForecastBench—58.6

Math Claude 3 Sonnet leads

Claude 3 Sonnet: 10.7 (#310), Llama 3-8B: 8.8 (#323)

Math benchmarks
BenchmarkClaude 3 SonnetLlama 3-8B
OTIS Mock AIME 2024-20252.5%1.9%
LMArena Math12131151
MATH Level 518.2%6.1%

Knowledge Claude 3 Sonnet leads

Claude 3 Sonnet: 21.1 (#276), Llama 3-8B: 7.8 (#308)

Knowledge benchmarks
BenchmarkClaude 3 SonnetLlama 3-8B
GPQA Diamond40.6%26.1%
LMArena Expert11731113
MMLU75.9%68.8%
ARC (AI2) Challenge—82.8%
OpenBookQA—82.6%
TriviaQA—67.7%

Multimodal Not comparable

Claude 3 Sonnet: 25.2 (#125), Llama 3-8B: —

Multimodal benchmarks
BenchmarkClaude 3 SonnetLlama 3-8B
LMArena Vision984—

Multilingual Claude 3 Sonnet leads

Claude 3 Sonnet: 37.8 (#234), Llama 3-8B: 30.8 (#261)

Multilingual benchmarks
BenchmarkClaude 3 SonnetLlama 3-8B
LMArena Non-English12051098
LMArena Chinese11891076
LMArena French12291159
LMArena German12041104
LMArena Japanese1131967
LMArena Korean11281004
LMArena Russian12271109
LMArena Spanish12041173

Instruction Following Claude 3 Sonnet leads

Claude 3 Sonnet: 62.8 (#235), Llama 3-8B: 58.4 (#260)

Instruction Following benchmarks
BenchmarkClaude 3 SonnetLlama 3-8B
LMArena Instruction Following11991127

Long Context Claude 3 Sonnet leads

Claude 3 Sonnet: 36.7 (#228), Llama 3-8B: 34.2 (#251)

Long Context benchmarks
BenchmarkClaude 3 SonnetLlama 3-8B
LMArena Longer Query12111128

Writing & Preference Claude 3 Sonnet leads

Claude 3 Sonnet: 42.1 (#238), Llama 3-8B: 37.5 (#256)

Writing & Preference benchmarks
BenchmarkClaude 3 SonnetLlama 3-8B
LMArena Text12181166
LMArena Creative Writing11861150
LMArena Multi-Turn12271152

Frequently asked questions

Is Claude 3 Sonnet better than Llama 3-8B?

Claude 3 Sonnet is the stronger model overall, scoring 29.0 to 25.5 on the Noometry Index.

Is Claude 3 Sonnet or Llama 3-8B better for coding?

Llama 3-8B scores higher on coding benchmarks: 31.0 versus 29.6 in the Noometry coding category.

How many benchmarks do Claude 3 Sonnet and Llama 3-8B share?

28 benchmarks have published results for both models. Claude 3 Sonnet has 30 scored results on Noometry and Llama 3-8B has 34.

Related comparisons

Go deeper