Model comparison

Claude Fable 5.1 vs GPT-6 Luna

Claude Fable 5.1 is the stronger model overall, scoring 69.0 to 53.3 on the Noometry Index. GPT-6 Luna costs 100× less per token, which makes it the better buy when Claude Fable 5.1's lead doesn't matter for your workload.

Last verified . 40 shared benchmarks.

Claude Fable 5.1 Anthropic

69.0

Rank #2 Confirmed

GPT-6 Luna OpenAI

53.3

Rank #36 Confirmed

Summary

  • They share 40 benchmarks with published results for both. Claude Fable 5.1 scores higher in 10 categories and GPT-6 Luna in 0 categories; 10 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Claude Fable 5.1 leads 76.7 to 48.2.
  • The biggest single-benchmark swing is Mystery Game Puzzles: 58% for Claude Fable 5.1 and 7% for GPT-6 Luna.
  • GPT-6 Luna is cheaper at $0.10 / $0.50 per million input/output tokens, against $10 / $50 for Claude Fable 5.1.
  • GPT-6 Luna accepts more context: 1.05M tokens versus 1M.

Side by side

Claude Fable 5.1 and GPT-6 Luna specifications
Claude Fable 5.1GPT-6 Luna
ProviderAnthropicOpenAI
Noometry Index69.053.3
Released2026-09-012026-09-22
WeightsProprietaryProprietary
Context window1M1.05M
Max output128K128K
Input $ / M tokens$10$0.10
Output $ / M tokens$50$0.50
Results tracked5242

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Fable 5.1 leads

Claude Fable 5.1: 74.7 (#1), GPT-6 Luna: 55.5 (#25)

Coding benchmarks
BenchmarkClaude Fable 5.1GPT-6 Luna
FrontierCode50.9%42.4%
LMArena WebDev17441581
SciCode63.1%54.6%
LMArena Coding15281439
ALE-Bench2,1431,577
DeepSWE—66.6%
CursorBench51.8%—
FrontierSWE56.3%—
GSO88.2%—
WeirdML92.9%—
MirrorCode73.3%—

Agentic & Tool Use Claude Fable 5.1 leads

Claude Fable 5.1: 50.7 (#5), GPT-6 Luna: 33.3 (#54)

Agentic & Tool Use benchmarks
BenchmarkClaude Fable 5.1GPT-6 Luna
APEX-Agents68.6%44.3%
GDP.pdf29.6%23%
Remote Labor Index17.9%—
Vending-Bench 25,422—

Reasoning Claude Fable 5.1 leads

Claude Fable 5.1: 76.7 (#7), GPT-6 Luna: 48.2 (#41)

Reasoning benchmarks
BenchmarkClaude Fable 5.1GPT-6 Luna
ARC-AGI-290%59.3%
NYT Connections (extended)90%68.7%
ARC-AGI-197.5%86.7%
CritPt31.1%19.4%
Chess Puzzles47%31%
LMArena Hard Prompts15261411
Mystery Game Puzzles58%7%
DTBench97.6%90.1%
LMCA65.5%44.5%
Epoch Capabilities Index164.7156.28
EBR-Bench57.1%—

Math Claude Fable 5.1 leads

Claude Fable 5.1: 89.6 (#4), GPT-6 Luna: 76.1 (#15)

Math benchmarks
BenchmarkClaude Fable 5.1GPT-6 Luna
FrontierMath (Tiers 1-3)90.2%78.9%
FrontierMath Tier 487.8%56.1%
OTIS Mock AIME 2024-2025100%98.9%
ProofBench100%64%
LMArena Math15251416
FrontierMath Erdős0%—

Knowledge Claude Fable 5.1 leads

Claude Fable 5.1: 69.6 (#6), GPT-6 Luna: 57.0 (#41)

Knowledge benchmarks
BenchmarkClaude Fable 5.1GPT-6 Luna
SimpleQA Verified70.8%41.4%
LMArena Expert15351444
GPQA Diamond—90.5%
Humanity's Last Exam46.5%—

Multimodal Claude Fable 5.1 leads

Claude Fable 5.1: 53.9 (#4), GPT-6 Luna: 42.4 (#30)

Multimodal benchmarks
BenchmarkClaude Fable 5.1GPT-6 Luna
LMArena Vision13181217
Blueprint-Bench 241.9%31.2%
Furniture Assembly70%44.2%
LMArena Document1513—

Multilingual Claude Fable 5.1 leads

Claude Fable 5.1: 59.1 (#3), GPT-6 Luna: 50.5 (#117)

Multilingual benchmarks
BenchmarkClaude Fable 5.1GPT-6 Luna
LMArena Non-English15071386
LMArena Chinese15861433
LMArena French15251420
LMArena German15001369
LMArena Japanese15431369
LMArena Korean15341360
LMArena Russian15211394
LMArena Spanish15161393

Instruction Following Claude Fable 5.1 leads

Claude Fable 5.1: 79.2 (#6), GPT-6 Luna: 74.3 (#99)

Instruction Following benchmarks
BenchmarkClaude Fable 5.1GPT-6 Luna
LMArena Instruction Following15171409

Long Context Claude Fable 5.1 leads

Claude Fable 5.1: 46.7 (#20), GPT-6 Luna: 43.0 (#111)

Long Context benchmarks
BenchmarkClaude Fable 5.1GPT-6 Luna
LMArena Longer Query15221409

Writing & Preference Claude Fable 5.1 leads

Claude Fable 5.1: 79.2 (#2), GPT-6 Luna: 58.3 (#119)

Writing & Preference benchmarks
BenchmarkClaude Fable 5.1GPT-6 Luna
LMArena Text15101391
LMArena Creative Writing15071363
LMArena Multi-Turn14921396
EQ-Bench Creative Writing2162—

Frequently asked questions

Is Claude Fable 5.1 better than GPT-6 Luna?

Claude Fable 5.1 is the stronger model overall, scoring 69.0 to 53.3 on the Noometry Index. GPT-6 Luna costs 100× less per token, which makes it the better buy when Claude Fable 5.1's lead doesn't matter for your workload.

Which is cheaper, Claude Fable 5.1 or GPT-6 Luna?

GPT-6 Luna is cheaper. It lists at $0.10 per million input tokens and $0.50 per million output tokens; Claude Fable 5.1 lists at $10 and $50.

Is Claude Fable 5.1 or GPT-6 Luna better for coding?

Claude Fable 5.1 scores higher on coding benchmarks: 74.7 versus 55.5 in the Noometry coding category.

Which has the bigger context window?

GPT-6 Luna does, with 1.05M tokens against 1M.

How many benchmarks do Claude Fable 5.1 and GPT-6 Luna share?

40 benchmarks have published results for both models. Claude Fable 5.1 has 52 scored results on Noometry and GPT-6 Luna has 42.

Related comparisons

Go deeper