Model comparison

GPT-4 Turbo vs Nvidia Llama 3.3 Nemotron Super 49b v1.5

Nvidia Llama 3.3 Nemotron Super 49b v1.5 is the stronger model overall, scoring 40.3 to 30.5 on the Noometry Index.

Last verified . 12 shared benchmarks.

GPT-4 Turbo OpenAI

30.5

Rank #292 Confirmed

Summary

  • They share 12 benchmarks with published results for both. GPT-4 Turbo scores higher in 0 categories and Nvidia Llama 3.3 Nemotron Super 49b v1.5 in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads 38.2 to 9.0.
  • Nvidia Llama 3.3 Nemotron Super 49b v1.5 is cheaper at $0.40 / $0.40 per million input/output tokens, against $10 / $30 for GPT-4 Turbo.
  • Nvidia Llama 3.3 Nemotron Super 49b v1.5 accepts more context: 131K tokens versus 128K.
  • Nvidia Llama 3.3 Nemotron Super 49b v1.5 has downloadable open weights; the other is API-only.

Side by side

GPT-4 Turbo and Nvidia Llama 3.3 Nemotron Super 49b v1.5 specifications
GPT-4 TurboNvidia Llama 3.3 Nemotron Super 49b v1.5
ProviderOpenAINVIDIA
Noometry Index30.540.3
Released2023-11-062025-07-25
WeightsProprietaryOpen
Context window128K131K
Max output4K131K
Input $ / M tokens$10$0.40
Output $ / M tokens$30$0.40
Results tracked3612

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

GPT-4 Turbo: 33.8 (#249), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 39.8 (#154)

Coding benchmarks
BenchmarkGPT-4 TurboNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Coding12681355
WeirdML18%—
BigCodeBench Instruct48.2%—
BigCodeBench Complete58.2%—
HumanEval+86.6%—
MBPP+73.3%—

Agentic & Tool Use Not comparable

GPT-4 Turbo: —, Nvidia Llama 3.3 Nemotron Super 49b v1.5: —

Agentic & Tool Use benchmarks
BenchmarkGPT-4 TurboNvidia Llama 3.3 Nemotron Super 49b v1.5
METR Time Horizons36.7%—

Reasoning Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

GPT-4 Turbo: 15.3 (#317), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 26.8 (#128)

Reasoning benchmarks
BenchmarkGPT-4 TurboNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Hard Prompts12511336
SimpleBench25.1%—
Chess Puzzles6%—
DTBench61.6%—
LMCA9.8%—
Epoch Capabilities Index127.25—
ForecastBench59.4—

Math Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

GPT-4 Turbo: 9.0 (#322), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 38.2 (#141)

Math benchmarks
BenchmarkGPT-4 TurboNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Math12721392
FrontierMath (Tiers 1-3)0.7%—
OTIS Mock AIME 2024-20256.7%—
MATH Level 546.7%—

Knowledge Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

GPT-4 Turbo: 24.3 (#268), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 36.7 (#165)

Knowledge benchmarks
BenchmarkGPT-4 TurboNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Expert12231330
GPQA Diamond46.6%—
Confabulations28.4%—
MMLU81.3%—

Multimodal Not comparable

GPT-4 Turbo: 30.6 (#110), Nvidia Llama 3.3 Nemotron Super 49b v1.5: —

Multimodal benchmarks
BenchmarkGPT-4 TurboNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Vision1090—

Multilingual Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

GPT-4 Turbo: 40.5 (#216), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 45.5 (#168)

Multilingual benchmarks
BenchmarkGPT-4 TurboNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Non-English12451316
LMArena Japanese11941300
LMArena Russian12591332
LMArena Chinese1242—
LMArena French1276—
LMArena German1259—
LMArena Korean1187—
LMArena Spanish1260—

Instruction Following Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

GPT-4 Turbo: 65.8 (#216), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 68.6 (#188)

Instruction Following benchmarks
BenchmarkGPT-4 TurboNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Instruction Following12491299

Long Context Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

GPT-4 Turbo: 38.0 (#206), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 40.0 (#164)

Long Context benchmarks
BenchmarkGPT-4 TurboNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Longer Query12541315

Writing & Preference Nvidia Llama 3.3 Nemotron Super 49b v1.5 leads

GPT-4 Turbo: 47.7 (#206), Nvidia Llama 3.3 Nemotron Super 49b v1.5: 53.1 (#159)

Writing & Preference benchmarks
BenchmarkGPT-4 TurboNvidia Llama 3.3 Nemotron Super 49b v1.5
LMArena Text12721338
LMArena Creative Writing12691307
LMArena Multi-Turn12671334

Frequently asked questions

Is GPT-4 Turbo better than Nvidia Llama 3.3 Nemotron Super 49b v1.5?

Nvidia Llama 3.3 Nemotron Super 49b v1.5 is the stronger model overall, scoring 40.3 to 30.5 on the Noometry Index.

Which is cheaper, GPT-4 Turbo or Nvidia Llama 3.3 Nemotron Super 49b v1.5?

Nvidia Llama 3.3 Nemotron Super 49b v1.5 is cheaper. It lists at $0.40 per million input tokens and $0.40 per million output tokens; GPT-4 Turbo lists at $10 and $30.

Is GPT-4 Turbo or Nvidia Llama 3.3 Nemotron Super 49b v1.5 better for coding?

Nvidia Llama 3.3 Nemotron Super 49b v1.5 scores higher on coding benchmarks: 39.8 versus 33.8 in the Noometry coding category.

Which has the bigger context window?

Nvidia Llama 3.3 Nemotron Super 49b v1.5 does, with 131K tokens against 128K.

How many benchmarks do GPT-4 Turbo and Nvidia Llama 3.3 Nemotron Super 49b v1.5 share?

12 benchmarks have published results for both models. GPT-4 Turbo has 36 scored results on Noometry and Nvidia Llama 3.3 Nemotron Super 49b v1.5 has 12.

Related comparisons

Go deeper