Model comparison

o1-mini vs Qwen3-Coder 480B-A35B Instruct

Qwen3-Coder 480B-A35B Instruct is the stronger model overall, scoring 38.1 to 34.0 on the Noometry Index.

Last verified . 18 shared benchmarks.

o1-mini OpenAI

34.0

Rank #235 Confirmed

Summary

  • They share 18 benchmarks with published results for both. o1-mini scores higher in 1 category and Qwen3-Coder 480B-A35B Instruct in 8 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Qwen3-Coder 480B-A35B Instruct leads 25.5 to 8.8.
  • Qwen3-Coder 480B-A35B Instruct has downloadable open weights; the other is API-only.

Side by side

o1-mini and Qwen3-Coder 480B-A35B Instruct specifications
o1-miniQwen3-Coder 480B-A35B Instruct
ProviderOpenAIAlibaba (Qwen)
Noometry Index34.038.1
Released2024-09-122025-04
WeightsProprietaryOpen
Context window—262K
Max output—66K
Input $ / M tokens—$1.50
Output $ / M tokens—$7.50
Results tracked3925

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

o1-mini: 35.5 (#224), Qwen3-Coder 480B-A35B Instruct: 35.5 (#223)

Coding benchmarks
Benchmarko1-miniQwen3-Coder 480B-A35B Instruct
WeirdML36.3%41.2%
LMArena Coding13621412
SWE-bench Verified (bash only)—55.4%
Aider Polyglot32.9%—
LMArena WebDev—1275
GSO—4.9%
LiveBench Coding48%—
ALE-Bench—461.45
AlgoTune—1.44
HumanEval+89%—
MBPP+78.8%—

Agentic & Tool Use Too close to call

o1-mini: 24.6 (#118), Qwen3-Coder 480B-A35B Instruct: 23.9 (#123)

Agentic & Tool Use benchmarks
Benchmarko1-miniQwen3-Coder 480B-A35B Instruct
Terminal-Bench—27.2%
Cybench10%—

Reasoning Qwen3-Coder 480B-A35B Instruct leads

o1-mini: 8.8 (#346), Qwen3-Coder 480B-A35B Instruct: 25.5 (#149)

Reasoning benchmarks
Benchmarko1-miniQwen3-Coder 480B-A35B Instruct
LMArena Hard Prompts13331372
ARC-AGI-20.8%—
SimpleBench18.1%—
Kagi LLM Benchmark—49.5%
ARC-AGI-114%—
LiveBench Reasoning72.3%—
LiveBench Data Analysis57.9%—
Epoch Capabilities Index135.82—
LiveBench57.8%—

Math Qwen3-Coder 480B-A35B Instruct leads

o1-mini: 35.4 (#186), Qwen3-Coder 480B-A35B Instruct: 37.6 (#150)

Math benchmarks
Benchmarko1-miniQwen3-Coder 480B-A35B Instruct
LMArena Math13581365
OTIS Mock AIME 2024-202546.9%—
LiveBench Math62%—
MATH Level 589.2%—
FrontierMath (Feb 2025 set)1.7%—

Knowledge Qwen3-Coder 480B-A35B Instruct leads

o1-mini: 34.9 (#192), Qwen3-Coder 480B-A35B Instruct: 37.0 (#162)

Knowledge benchmarks
Benchmarko1-miniQwen3-Coder 480B-A35B Instruct
LMArena Expert13161338
GPQA Diamond62.4%—
Confabulations18.6%—

Multilingual Qwen3-Coder 480B-A35B Instruct leads

o1-mini: 43.6 (#182), Qwen3-Coder 480B-A35B Instruct: 47.7 (#148)

Multilingual benchmarks
Benchmarko1-miniQwen3-Coder 480B-A35B Instruct
LMArena Non-English12891346
LMArena Chinese13141357
LMArena French12931398
LMArena German12781325
LMArena Japanese12451310
LMArena Korean12231305
LMArena Russian12831366
LMArena Spanish13031360

Instruction Following Qwen3-Coder 480B-A35B Instruct leads

o1-mini: 66.7 (#206), Qwen3-Coder 480B-A35B Instruct: 71.6 (#147)

Instruction Following benchmarks
Benchmarko1-miniQwen3-Coder 480B-A35B Instruct
LMArena Instruction Following13041355
LiveBench Instruction Following65.4%—

Long Context Qwen3-Coder 480B-A35B Instruct leads

o1-mini: 40.1 (#161), Qwen3-Coder 480B-A35B Instruct: 42.0 (#131)

Long Context benchmarks
Benchmarko1-miniQwen3-Coder 480B-A35B Instruct
LMArena Longer Query13201378

Writing & Preference Qwen3-Coder 480B-A35B Instruct leads

o1-mini: 48.4 (#202), Qwen3-Coder 480B-A35B Instruct: 55.3 (#147)

Writing & Preference benchmarks
Benchmarko1-miniQwen3-Coder 480B-A35B Instruct
LMArena Text13171357
LMArena Creative Writing12441333
LMArena Multi-Turn13141365
Short-Story Creative Writing64.9%—
LiveBench Language40.9%—

Frequently asked questions

Is o1-mini better than Qwen3-Coder 480B-A35B Instruct?

Qwen3-Coder 480B-A35B Instruct is the stronger model overall, scoring 38.1 to 34.0 on the Noometry Index.

Is o1-mini or Qwen3-Coder 480B-A35B Instruct better for coding?

They score almost the same on coding (35.5 vs 35.5); test both on your own repository before choosing.

How many benchmarks do o1-mini and Qwen3-Coder 480B-A35B Instruct share?

18 benchmarks have published results for both models. o1-mini has 39 scored results on Noometry and Qwen3-Coder 480B-A35B Instruct has 25.

Related comparisons

Go deeper