Model comparison
o3-pro vs Step 2 16k Exp 202412
o3-pro is the stronger model overall, scoring 42.9 to 39.2 on the Noometry Index.
Last verified . 0 shared benchmarks.
Summary
- The widest gap is in long context, where o3-pro leads 72.2 to 39.7.
Side by side
| o3-pro | Step 2 16k Exp 202412 | |
|---|---|---|
| Provider | OpenAI | StepFun |
| Noometry Index | 42.9 | 39.2 |
| Released | 2025-06-10 | — |
| Weights | Proprietary | Proprietary |
| Context window | 200K | — |
| Max output | 100K | — |
| Input $ / M tokens | $20 | — |
| Output $ / M tokens | $80 | — |
| Results tracked | 12 | 12 |
Sponsored placements are available on pages like this one. Advertise on Noometry
Category by category
Coding o3-pro leads
o3-pro: 55.5 (#24), Step 2 16k Exp 202412: 38.5 (#174)
| Benchmark | o3-pro | Step 2 16k Exp 202412 |
|---|---|---|
| Aider Polyglot | 84.9% | — |
| WeirdML | 58.2% | — |
| LMArena Coding | — | 1316 |
Reasoning Step 2 16k Exp 202412 leads
o3-pro: 23.8 (#171), Step 2 16k Exp 202412: 25.9 (#142)
| Benchmark | o3-pro | Step 2 16k Exp 202412 |
|---|---|---|
| ARC-AGI-2 | 4.9% | — |
| Kagi LLM Benchmark | 72.1% | — |
| ARC-AGI-1 | 59.3% | — |
| LMArena Hard Prompts | — | 1299 |
| DTBench | 86.9% | — |
| LMCA | 38.5% | — |
| Epoch Capabilities Index | 147.42 | — |
Math Not comparable
o3-pro: —, Step 2 16k Exp 202412: 36.3 (#169)
| Benchmark | o3-pro | Step 2 16k Exp 202412 |
|---|---|---|
| LMArena Math | — | 1304 |
Knowledge Step 2 16k Exp 202412 leads
o3-pro: 29.5 (#238), Step 2 16k Exp 202412: 35.2 (#187)
| Benchmark | o3-pro | Step 2 16k Exp 202412 |
|---|---|---|
| Confabulations | 14.2% | — |
| Vectara Hallucination Rate | 23.3% | — |
| LMArena Expert | — | 1279 |
Multilingual Not comparable
o3-pro: —, Step 2 16k Exp 202412: 43.7 (#181)
| Benchmark | o3-pro | Step 2 16k Exp 202412 |
|---|---|---|
| LMArena Non-English | — | 1290 |
| LMArena Chinese | — | 1331 |
| LMArena Russian | — | 1324 |
Instruction Following Not comparable
o3-pro: —, Step 2 16k Exp 202412: 67.9 (#192)
| Benchmark | o3-pro | Step 2 16k Exp 202412 |
|---|---|---|
| LMArena Instruction Following | — | 1287 |
Long Context o3-pro leads
o3-pro: 72.2 (#1), Step 2 16k Exp 202412: 39.7 (#170)
| Benchmark | o3-pro | Step 2 16k Exp 202412 |
|---|---|---|
| Fiction.LiveBench | 97.2% | — |
| LMArena Longer Query | — | 1307 |
Writing & Preference o3-pro leads
o3-pro: 57.1 (#133), Step 2 16k Exp 202412: 52.3 (#173)
| Benchmark | o3-pro | Step 2 16k Exp 202412 |
|---|---|---|
| LMArena Text | — | 1321 |
| LMArena Creative Writing | — | 1328 |
| Short-Story Creative Writing | 84.4% | — |
| LMArena Multi-Turn | — | 1292 |
Frequently asked questions
Is o3-pro better than Step 2 16k Exp 202412?
o3-pro is the stronger model overall, scoring 42.9 to 39.2 on the Noometry Index.
Is o3-pro or Step 2 16k Exp 202412 better for coding?
o3-pro scores higher on coding benchmarks: 55.5 versus 38.5 in the Noometry coding category.
How many benchmarks do o3-pro and Step 2 16k Exp 202412 share?
0 benchmarks have published results for both models. o3-pro has 12 scored results on Noometry and Step 2 16k Exp 202412 has 12.