Model comparison

GPT-4.1 nano vs gpt-oss-120b

gpt-oss-120b is the stronger model overall, scoring 36.3 to 27.9 on the Noometry Index.

Last verified . 31 shared benchmarks.

GPT-4.1 nano OpenAI

27.9

Rank #327 Confirmed

gpt-oss-120b OpenAI

36.3

Rank #217 Confirmed

Summary

  • They share 31 benchmarks with published results for both. GPT-4.1 nano scores higher in 1 category and gpt-oss-120b in 8 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in math, where gpt-oss-120b leads 52.5 to 26.9.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 28.9% for GPT-4.1 nano and 88.9% for gpt-oss-120b.
  • gpt-oss-120b is cheaper at $0.037 / $0.17 per million input/output tokens, against $0.10 / $0.40 for GPT-4.1 nano.
  • GPT-4.1 nano accepts more context: 1.05M tokens versus 131K.
  • gpt-oss-120b has downloadable open weights; the other is API-only.

Side by side

GPT-4.1 nano and gpt-oss-120b specifications
GPT-4.1 nanogpt-oss-120b
ProviderOpenAIOpenAI
Noometry Index27.936.3
Released2025-04-142025-08-05
WeightsProprietaryOpen
Context window1.05M131K
Max output33K41K
Input $ / M tokens$0.10$0.037
Output $ / M tokens$0.40$0.17
Results tracked3848

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding gpt-oss-120b leads

GPT-4.1 nano: 24.1 (#330), gpt-oss-120b: 33.5 (#256)

Coding benchmarks
BenchmarkGPT-4.1 nanogpt-oss-120b
Aider Polyglot8.9%41.8%
SciCode25.9%36%
WeirdML19%48.2%
LMArena Coding13061380
SWE-bench Verified (bash only)—26%
ALE-Bench—575.62
AlgoTune—1.41

Agentic & Tool Use GPT-4.1 nano leads

GPT-4.1 nano: 26.5 (#104), gpt-oss-120b: 12.2 (#153)

Agentic & Tool Use benchmarks
BenchmarkGPT-4.1 nanogpt-oss-120b
Terminal-Bench—18.7%
APEX-Agents—4.4%
Berkeley Function Calling Leaderboard33%—
METR Time Horizons—56.6%
Vending-Bench 2—-21.53

Reasoning gpt-oss-120b leads

GPT-4.1 nano: 8.5 (#349), gpt-oss-120b: 20.0 (#245)

Reasoning benchmarks
BenchmarkGPT-4.1 nanogpt-oss-120b
Kagi LLM Benchmark33.3%58.6%
CritPt0%1.1%
LMArena Hard Prompts12861364
DTBench52.5%76.3%
LMCA5.5%22.1%
Epoch Capabilities Index129.62139.93
ARC-AGI-20%—
SimpleBench—22.1%
ARC-AGI-10%—
Chess Puzzles—20%
Mystery Game Puzzles—2%
Surface Evolver Bench—25%

Math gpt-oss-120b leads

GPT-4.1 nano: 26.9 (#252), gpt-oss-120b: 52.5 (#50)

Math benchmarks
BenchmarkGPT-4.1 nanogpt-oss-120b
OTIS Mock AIME 2024-202528.9%88.9%
Omni-MATH36.7%68.8%
LMArena Math12741389
MATH Level 570%—
FrontierMath (Feb 2025 set)1%—

Knowledge gpt-oss-120b leads

GPT-4.1 nano: 21.8 (#273), gpt-oss-120b: 42.4 (#96)

Knowledge benchmarks
BenchmarkGPT-4.1 nanogpt-oss-120b
GPQA Diamond48.9%75.8%
MMLU-Pro55%79.5%
GPQA (HELM)50.7%68.4%
LMArena Expert12721356
SimpleQA Verified6%—
Confabulations—15.7%
Vectara Hallucination Rate—14.2%

Multimodal Not comparable

GPT-4.1 nano: 29.2 (#113), gpt-oss-120b: —

Multimodal benchmarks
BenchmarkGPT-4.1 nanogpt-oss-120b
LMArena Vision1063—

Multilingual gpt-oss-120b leads

GPT-4.1 nano: 41.6 (#205), gpt-oss-120b: 48.0 (#147)

Multilingual benchmarks
BenchmarkGPT-4.1 nanogpt-oss-120b
LMArena Non-English12601351
LMArena Chinese12701385
LMArena German12881353
LMArena Japanese11981331
LMArena Russian12611343
LMArena French—1369
LMArena Korean—1282
LMArena Spanish—1389

Instruction Following gpt-oss-120b leads

GPT-4.1 nano: 67.8 (#193), gpt-oss-120b: 69.3 (#173)

Instruction Following benchmarks
BenchmarkGPT-4.1 nanogpt-oss-120b
IFEval84.3%83.6%
LMArena Instruction Following12671318

Long Context gpt-oss-120b leads

GPT-4.1 nano: 23.7 (#296), gpt-oss-120b: 31.4 (#278)

Long Context benchmarks
BenchmarkGPT-4.1 nanogpt-oss-120b
Fiction.LiveBench25%44.4%
LMArena Longer Query12831319

Writing & Preference gpt-oss-120b leads

GPT-4.1 nano: 40.5 (#243), gpt-oss-120b: 46.5 (#217)

Writing & Preference benchmarks
BenchmarkGPT-4.1 nanogpt-oss-120b
LMArena Text12851365
LMArena Creative Writing12601275
EQ-Bench Creative Writing946961
WildBench81.2%84.5%
LMArena Multi-Turn12771340
Short-Story Creative Writing—77.1%

Frequently asked questions

Is GPT-4.1 nano better than gpt-oss-120b?

gpt-oss-120b is the stronger model overall, scoring 36.3 to 27.9 on the Noometry Index.

Which is cheaper, GPT-4.1 nano or gpt-oss-120b?

gpt-oss-120b is cheaper. It lists at $0.037 per million input tokens and $0.17 per million output tokens; GPT-4.1 nano lists at $0.10 and $0.40.

Is GPT-4.1 nano or gpt-oss-120b better for coding?

gpt-oss-120b scores higher on coding benchmarks: 33.5 versus 24.1 in the Noometry coding category.

Which has the bigger context window?

GPT-4.1 nano does, with 1.05M tokens against 131K.

How many benchmarks do GPT-4.1 nano and gpt-oss-120b share?

31 benchmarks have published results for both models. GPT-4.1 nano has 38 scored results on Noometry and gpt-oss-120b has 48.

Related comparisons

Go deeper