Model comparison

Phi 3 Mini 4k Instruct June 2024 vs Qwen3.5 35B-A3B

Qwen3.5 35B-A3B is the stronger model overall, scoring 42.0 to 31.3 on the Noometry Index.

Last verified . 15 shared benchmarks.

Qwen3.5 35B-A3B Alibaba (Qwen)

42.0

Rank #123 Confirmed

Summary

  • They share 15 benchmarks with published results for both. Phi 3 Mini 4k Instruct June 2024 scores higher in 0 categories and Qwen3.5 35B-A3B in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Qwen3.5 35B-A3B leads 57.9 to 29.6.

Side by side

Phi 3 Mini 4k Instruct June 2024 and Qwen3.5 35B-A3B specifications
Phi 3 Mini 4k Instruct June 2024Qwen3.5 35B-A3B
ProviderMicrosoftAlibaba (Qwen)
Noometry Index31.342.0
Released—2026-02-01
WeightsOpenOpen
Context window—262K
Max output—66K
Input $ / M tokens—$0.25
Output $ / M tokens—$2
Results tracked1528

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Qwen3.5 35B-A3B leads

Phi 3 Mini 4k Instruct June 2024: 31.8 (#279), Qwen3.5 35B-A3B: 33.8 (#251)

Coding benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen3.5 35B-A3B
LMArena Coding10931410
LMArena WebDev—1254
SciCode—29.3%

Reasoning Qwen3.5 35B-A3B leads

Phi 3 Mini 4k Instruct June 2024: 20.8 (#231), Qwen3.5 35B-A3B: 24.6 (#161)

Reasoning benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen3.5 35B-A3B
LMArena Hard Prompts10871400
CritPt—0.6%
Chess Puzzles—10%
DTBench—80%
LMCA—29.5%
Epoch Capabilities Index—142.52

Math Qwen3.5 35B-A3B leads

Phi 3 Mini 4k Instruct June 2024: 33.0 (#208), Qwen3.5 35B-A3B: 39.9 (#97)

Math benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen3.5 35B-A3B
LMArena Math11521404
MathArena Final-Answer Competitions—56%
OTIS Mock AIME 2024-2025—70%

Knowledge Qwen3.5 35B-A3B leads

Phi 3 Mini 4k Instruct June 2024: 28.6 (#244), Qwen3.5 35B-A3B: 47.8 (#79)

Knowledge benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen3.5 35B-A3B
LMArena Expert10511408
GPQA Diamond—83.5%
Vectara Hallucination Rate—10.5%

Multilingual Qwen3.5 35B-A3B leads

Phi 3 Mini 4k Instruct June 2024: 25.9 (#282), Qwen3.5 35B-A3B: 50.0 (#127)

Multilingual benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen3.5 35B-A3B
LMArena Non-English10131378
LMArena Chinese10331457
LMArena German10311367
LMArena Japanese9541325
LMArena Korean8801356
LMArena Russian10191376
LMArena French—1412
LMArena Spanish—1392

Instruction Following Qwen3.5 35B-A3B leads

Phi 3 Mini 4k Instruct June 2024: 54.1 (#282), Qwen3.5 35B-A3B: 72.8 (#128)

Instruction Following benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen3.5 35B-A3B
LMArena Instruction Following10581379

Long Context Qwen3.5 35B-A3B leads

Phi 3 Mini 4k Instruct June 2024: 31.7 (#277), Qwen3.5 35B-A3B: 42.4 (#127)

Long Context benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen3.5 35B-A3B
LMArena Longer Query10421389

Writing & Preference Qwen3.5 35B-A3B leads

Phi 3 Mini 4k Instruct June 2024: 29.6 (#294), Qwen3.5 35B-A3B: 57.9 (#124)

Writing & Preference benchmarks
BenchmarkPhi 3 Mini 4k Instruct June 2024Qwen3.5 35B-A3B
LMArena Text10801395
LMArena Creative Writing10451346
LMArena Multi-Turn10491390

Frequently asked questions

Is Phi 3 Mini 4k Instruct June 2024 better than Qwen3.5 35B-A3B?

Qwen3.5 35B-A3B is the stronger model overall, scoring 42.0 to 31.3 on the Noometry Index.

Is Phi 3 Mini 4k Instruct June 2024 or Qwen3.5 35B-A3B better for coding?

Qwen3.5 35B-A3B scores higher on coding benchmarks: 33.8 versus 31.8 in the Noometry coding category.

How many benchmarks do Phi 3 Mini 4k Instruct June 2024 and Qwen3.5 35B-A3B share?

15 benchmarks have published results for both models. Phi 3 Mini 4k Instruct June 2024 has 15 scored results on Noometry and Qwen3.5 35B-A3B has 28.

Related comparisons

Go deeper