Model comparison

Claude 3 Sonnet vs Nvidia Llama 3.3 Nemotron Super 49b v1.5

Nvidia Llama 3.3 Nemotron Super 49b v1.5 is the stronger model overall, scoring 40.3 to 29.0 on the Noometry Index.

Last verified . 12 shared benchmarks.

Claude 3 Sonnet Anthropic

29.0

Rank #319 Confirmed

Summary

  • They share 12 benchmarks with published results for both. Claude 3 Sonnet scores higher in 0 categories and Nvidia Llama 3.3 Nemotron Super 49b v1.5 in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads 38.2 to 10.7.
  • Nvidia Llama 3.3 Nemotron Super 49b v1.5 has downloadable open weights; the other is API-only.

Side by side

Claude 3 Sonnet and Nvidia Llama 3.3 Nemotron Super 49b v1.5 specifications
Claude 3 SonnetNvidia Llama 3.3 Nemotron Super 49b v1.5
ProviderAnthropicNVIDIA
Noometry Index29.040.3
Released2024-02-292025-07-25
WeightsProprietaryOpen
Context window—131K
Max output—131K
Input $ / M tokens—$0.40
Output $ / M tokens—$0.40
Results tracked3012

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

Claude 3 Sonnet: 29.6 (#302), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 39.8 (#154)

Coding benchmarks
BenchmarkClaude 3 SonnetNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Coding12231355
WeirdML10.2%—
BigCodeBench Instruct42.7%—
BigCodeBench Complete53.8%—
HumanEval+64%—
MBPP+69.3%—

Reasoning Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

Claude 3 Sonnet: 20.5 (#237), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 26.8 (#128)

Reasoning benchmarks
BenchmarkClaude 3 SonnetNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Hard Prompts11971336
DTBench53.6%—
Epoch Capabilities Index120.7—
WinoGrande75.1%—

Math Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

Claude 3 Sonnet: 10.7 (#310), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 38.2 (#141)

Math benchmarks
BenchmarkClaude 3 SonnetNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Math12131392
OTIS Mock AIME 2024-20252.5%—
MATH Level 518.2%—

Knowledge Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

Claude 3 Sonnet: 21.1 (#276), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 36.7 (#165)

Knowledge benchmarks
BenchmarkClaude 3 SonnetNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Expert11731330
GPQA Diamond40.6%—
MMLU75.9%—

Multimodal Not comparable

Claude 3 Sonnet: 25.2 (#125), Nvidia Llama 3.3 Nemotron Super 49b v1.5: —

Multimodal benchmarks
BenchmarkClaude 3 SonnetNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Vision984—

Multilingual Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

Claude 3 Sonnet: 37.8 (#234), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 45.5 (#168)

Multilingual benchmarks
BenchmarkClaude 3 SonnetNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Non-English12051316
LMArena Japanese11311300
LMArena Russian12271332
LMArena Chinese1189—
LMArena French1229—
LMArena German1204—
LMArena Korean1128—
LMArena Spanish1204—

Instruction Following Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

Claude 3 Sonnet: 62.8 (#235), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 68.6 (#188)

Instruction Following benchmarks
BenchmarkClaude 3 SonnetNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Instruction Following11991299

Long Context Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

Claude 3 Sonnet: 36.7 (#228), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 40.0 (#164)

Long Context benchmarks
BenchmarkClaude 3 SonnetNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Longer Query12111315

Writing & Preference Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

Claude 3 Sonnet: 42.1 (#238), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 53.1 (#159)

Writing & Preference benchmarks
BenchmarkClaude 3 SonnetNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Text12181338
LMArena Creative Writing11861307
LMArena Multi-Turn12271334

Frequently asked questions

Is Claude 3 Sonnet better than Nvidia Llama 3.3 Nemotron Super 49b v1.5?

Nvidia Llama 3.3 Nemotron Super 49b v1.5 is the stronger model overall, scoring 40.3 to 29.0 on the Noometry Index.

Is Claude 3 Sonnet or Nvidia Llama 3.3 Nemotron Super 49b v1.5 better for coding?

Nvidia Llama 3.3 Nemotron Super 49b v1.5 scores higher on coding benchmarks: 39.8 versus 29.6 in the Noometry coding category.

How many benchmarks do Claude 3 Sonnet and Nvidia Llama 3.3 Nemotron Super 49b v1.5 share?

12 benchmarks have published results for both models. Claude 3 Sonnet has 30 scored results on Noometry and Nvidia Llama 3.3 Nemotron Super 49b v1.5 has 12.

Related comparisons

Go deeper