Model comparison

Qwen3.5 122B-A10B vs Step 3

Qwen3.5 122B-A10B is the stronger model overall, scoring 42.1 to 40.5 on the Noometry Index.

Last verified . 16 shared benchmarks.

Qwen3.5 122B-A10B Alibaba (Qwen)

42.1

Rank #119 Confirmed

Step 3 StepFun

40.5

Rank #149 Confirmed

Summary

  • They share 16 benchmarks with published results for both. Qwen3.5 122B-A10B scores higher in 7 categories and Step 3 in 2 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Qwen3.5 122B-A10B leads 60.0 to 54.3.

Side by side

Qwen3.5 122B-A10B and Step 3 specifications
Qwen3.5 122B-A10BStep 3
ProviderAlibaba (Qwen)StepFun
Noometry Index42.140.5
Released2026-02-23—
WeightsOpenOpen
Context window262K—
Max output66K—
Input $ / M tokens$0.40—
Output $ / M tokens$3.20—
Results tracked2717

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Step 3 leads

Qwen3.5 122B-A10B: 39.1 (#162), Step 3: 40.1 (#147)

Coding benchmarks
BenchmarkQwen3.5 122B-A10BStep 3
LMArena Coding14361367
LMArena WebDev1360—
SciCode35.6%—

Reasoning Step 3 leads

Qwen3.5 122B-A10B: 27.2 (#123), Step 3: 28.4 (#105)

Reasoning benchmarks
BenchmarkQwen3.5 122B-A10BStep 3
LMArena Hard Prompts14211355
Kagi LLM Benchmark—62.3%
NYT Connections (extended)51.7%—
CritPt0.9%—
Thematic Generalization51.2%—
Mystery Game Puzzles17%—
DTBench84.3%—
LMCA32.2%—

Math Qwen3.5 122B-A10B leads

Qwen3.5 122B-A10B: 39.1 (#112), Step 3: 37.6 (#148)

Math benchmarks
BenchmarkQwen3.5 122B-A10BStep 3
LMArena Math14321366

Knowledge Qwen3.5 122B-A10B leads

Qwen3.5 122B-A10B: 38.8 (#142), Step 3: 36.8 (#164)

Knowledge benchmarks
BenchmarkQwen3.5 122B-A10BStep 3
LMArena Expert14321333
Vectara Hallucination Rate11.2%—

Multimodal Qwen3.5 122B-A10B leads

Qwen3.5 122B-A10B: 39.6 (#57), Step 3: 35.5 (#86)

Multimodal benchmarks
BenchmarkQwen3.5 122B-A10BStep 3
LMArena Vision12451177

Multilingual Qwen3.5 122B-A10B leads

Qwen3.5 122B-A10B: 51.6 (#107), Step 3: 46.3 (#159)

Multilingual benchmarks
BenchmarkQwen3.5 122B-A10BStep 3
LMArena Non-English14001327
LMArena Chinese14621397
LMArena German14261371
LMArena Korean13521269
LMArena Russian14001331
LMArena Spanish14241371
LMArena French1442—
LMArena Japanese1367—

Instruction Following Qwen3.5 122B-A10B leads

Qwen3.5 122B-A10B: 73.8 (#115), Step 3: 70.4 (#164)

Instruction Following benchmarks
BenchmarkQwen3.5 122B-A10BStep 3
LMArena Instruction Following13991332

Long Context Qwen3.5 122B-A10B leads

Qwen3.5 122B-A10B: 43.0 (#109), Step 3: 40.3 (#157)

Long Context benchmarks
BenchmarkQwen3.5 122B-A10BStep 3
LMArena Longer Query14101326

Writing & Preference Qwen3.5 122B-A10B leads

Qwen3.5 122B-A10B: 60.0 (#105), Step 3: 54.3 (#151)

Writing & Preference benchmarks
BenchmarkQwen3.5 122B-A10BStep 3
LMArena Text14171350
LMArena Creative Writing13681321
LMArena Multi-Turn14161341

Frequently asked questions

Is Qwen3.5 122B-A10B better than Step 3?

Qwen3.5 122B-A10B is the stronger model overall, scoring 42.1 to 40.5 on the Noometry Index.

Is Qwen3.5 122B-A10B or Step 3 better for coding?

Step 3 scores higher on coding benchmarks: 40.1 versus 39.1 in the Noometry coding category.

How many benchmarks do Qwen3.5 122B-A10B and Step 3 share?

16 benchmarks have published results for both models. Qwen3.5 122B-A10B has 27 scored results on Noometry and Step 3 has 17.

Related comparisons

Go deeper