Model comparison

Chatgpt 4o Latest 20250326 vs Llama 13b

Chatgpt 4o Latest 20250326 is the stronger model overall, scoring 43.8 to 24.4 on the Noometry Index.

Last verified . 8 shared benchmarks.

Chatgpt 4o Latest 20250326 OpenAI

43.8

Rank #82 Confirmed

Llama 13b Meta

24.4

Rank #348 Confirmed

Summary

  • They share 8 benchmarks with published results for both. Chatgpt 4o Latest 20250326 scores higher in 6 categories and Llama 13b in 0 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Chatgpt 4o Latest 20250326 leads 62.6 to 13.8.
  • Llama 13b has downloadable open weights; the other is API-only.

Side by side

Chatgpt 4o Latest 20250326 and Llama 13b specifications
Chatgpt 4o Latest 20250326Llama 13b
ProviderOpenAIMeta
Noometry Index43.824.4
Released—2023-02-24
WeightsProprietaryOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked2121

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 41.6 (#122), Llama 13b: 21.4 (#337)

Coding benchmarks
BenchmarkChatgpt 4o Latest 20250326Llama 13b
LMArena Coding1413683

Reasoning Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 33.8 (#71), Llama 13b: 14.0 (#329)

Reasoning benchmarks
BenchmarkChatgpt 4o Latest 20250326Llama 13b
LMArena Hard Prompts1424728
Kagi LLM Benchmark75%—
BIG-Bench Hard—37.9%
Epoch Capabilities Index—100.58
HellaSwag—79.2%
LAMBADA—75.2%
PIQA—80.1%
WinoGrande—73%

Math Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 38.6 (#134), Llama 13b: 26.7 (#256)

Math benchmarks
BenchmarkChatgpt 4o Latest 20250326Llama 13b
LMArena Math1407838
GSM8K—20.6%

Knowledge Not comparable

Chatgpt 4o Latest 20250326: 39.2 (#137), Llama 13b: —

Knowledge benchmarks
BenchmarkChatgpt 4o Latest 20250326Llama 13b
Confabulations16.6%—
LMArena Expert1401—
ARC (AI2) Challenge—52.7%
BoolQ—78.7%
MMLU—47.7%
OpenBookQA—56.4%
TriviaQA—77.9%

Multimodal Not comparable

Chatgpt 4o Latest 20250326: 39.6 (#58), Llama 13b: —

Multimodal benchmarks
BenchmarkChatgpt 4o Latest 20250326Llama 13b
LMArena Vision1243—
ScienceQA—43.3%

Multilingual Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 52.9 (#76), Llama 13b: 16.6 (#297)

Multilingual benchmarks
BenchmarkChatgpt 4o Latest 20250326Llama 13b
LMArena Non-English1419819
LMArena Chinese1457—
LMArena French1446—
LMArena German1423—
LMArena Japanese1405—
LMArena Korean1396—
LMArena Russian1429—
LMArena Spanish1434—

Instruction Following Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 74.0 (#107), Llama 13b: 36.7 (#305)

Instruction Following benchmarks
BenchmarkChatgpt 4o Latest 20250326Llama 13b
LMArena Instruction Following1403781

Long Context Not comparable

Chatgpt 4o Latest 20250326: 43.1 (#107), Llama 13b: —

Long Context benchmarks
BenchmarkChatgpt 4o Latest 20250326Llama 13b
LMArena Longer Query1413—

Writing & Preference Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 62.6 (#72), Llama 13b: 13.8 (#312)

Writing & Preference benchmarks
BenchmarkChatgpt 4o Latest 20250326Llama 13b
LMArena Text1429834
LMArena Creative Writing1405794
LMArena Multi-Turn1454753
EQ-Bench Creative Writing1501—

Frequently asked questions

Is Chatgpt 4o Latest 20250326 better than Llama 13b?

Chatgpt 4o Latest 20250326 is the stronger model overall, scoring 43.8 to 24.4 on the Noometry Index.

Is Chatgpt 4o Latest 20250326 or Llama 13b better for coding?

Chatgpt 4o Latest 20250326 scores higher on coding benchmarks: 41.6 versus 21.4 in the Noometry coding category.

How many benchmarks do Chatgpt 4o Latest 20250326 and Llama 13b share?

8 benchmarks have published results for both models. Chatgpt 4o Latest 20250326 has 21 scored results on Noometry and Llama 13b has 21.

Related comparisons

Go deeper