Model comparison

Claude Sonnet 4.6 vs Qwen3.6 Max Preview

Qwen3.6 Max Preview is the stronger model overall, scoring 51.5 to 50.3 on the Noometry Index.

Last verified . 28 shared benchmarks.

Claude Sonnet 4.6 Anthropic

50.3

Rank #50 Confirmed

Qwen3.6 Max Preview Alibaba (Qwen)

51.5

Rank #43 Confirmed

Summary

  • They share 28 benchmarks with published results for both. Claude Sonnet 4.6 scores higher in 5 categories and Qwen3.6 Max Preview in 3 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Claude Sonnet 4.6 leads 70.2 to 63.8.
  • The biggest single-benchmark swing is SimpleQA Verified: 35.5% for Claude Sonnet 4.6 and 52% for Qwen3.6 Max Preview.
  • Qwen3.6 Max Preview is cheaper at $1.30 / $7.80 per million input/output tokens, against $3 / $15 for Claude Sonnet 4.6.
  • Claude Sonnet 4.6 accepts more context: 1M tokens versus 262K.

Side by side

Claude Sonnet 4.6 and Qwen3.6 Max Preview specifications
Claude Sonnet 4.6Qwen3.6 Max Preview
ProviderAnthropicAlibaba (Qwen)
Noometry Index50.351.5
Released2026-02-172026-04-20
WeightsProprietaryProprietary
Context window1M262K
Max output128K66K
Input $ / M tokens$3$1.30
Output $ / M tokens$15$7.80
Results tracked5729

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Qwen3.6 Max Preview leads

Claude Sonnet 4.6: 46.3 (#67), Qwen3.6 Max Preview: 48.7 (#54)

Coding benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.6 Max Preview
SWE-bench Verified75.2%76.7%
LMArena WebDev15221482
LMArena Coding15041471
DeepSWE29.9%—
FrontierCode24.3%—
SciCode46.8%—
WeirdML66.1%—
ALE-Bench1,327—

Agentic & Tool Use Not comparable

Claude Sonnet 4.6: 39.1 (#28), Qwen3.6 Max Preview: —

Agentic & Tool Use benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.6 Max Preview
Vending-Bench 27,2044,254
Terminal-Bench53.4%—
APEX-Agents43%—
OSWorld 2.09.3%—
DeepResearch Bench54.9%—
OSWorld72.1%—
ExploitBench23.6%—
GBAEval48.8%—
GDP.pdf18%—
LMArena Search1221—

Reasoning Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 46.1 (#45), Qwen3.6 Max Preview: 41.7 (#53)

Reasoning benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.6 Max Preview
NYT Connections (extended)80.9%74.1%
Chess Puzzles13%20%
LMArena Hard Prompts14841457
Mystery Game Puzzles16%19%
DTBench89.9%87.2%
LMCA46.5%42.5%
Epoch Capabilities Index152.24149.24
ARC-AGI-260.4%—
SimpleBench—63%
ARC-AGI-186.5%—
CritPt3.1%—
Thematic Generalization76.3%—
ForecastBench62—

Math Qwen3.6 Max Preview leads

Claude Sonnet 4.6: 52.9 (#49), Qwen3.6 Max Preview: 54.1 (#46)

Math benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.6 Max Preview
OTIS Mock AIME 2024-202585.8%91.1%
LMArena Math14621465
FrontierMath (Feb 2025 set)32.4%23.1%
FrontierMath Tier 4 (v1)8.3%4.2%
ProofBench45%—

Knowledge Qwen3.6 Max Preview leads

Claude Sonnet 4.6: 51.7 (#65), Qwen3.6 Max Preview: 57.6 (#39)

Knowledge benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.6 Max Preview
GPQA Diamond87.4%87.4%
SimpleQA Verified35.5%52%
LMArena Expert15001478
Vectara Hallucination Rate10.6%—

Multimodal Not comparable

Claude Sonnet 4.6: 38.0 (#68), Qwen3.6 Max Preview: —

Multimodal benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.6 Max Preview
LMArena Vision1283—
Blueprint-Bench 26.7%—
LMArena Document1482—

Multilingual Too close to call

Claude Sonnet 4.6: 54.4 (#41), Qwen3.6 Max Preview: 54.2 (#48)

Multilingual benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.6 Max Preview
LMArena Non-English14401437
LMArena Chinese14911487
LMArena French14651449
LMArena Russian14401445
LMArena Spanish14641454
LMArena German1428—
LMArena Japanese1420—
LMArena Korean1411—

Instruction Following Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 77.4 (#25), Qwen3.6 Max Preview: 75.7 (#55)

Instruction Following benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.6 Max Preview
LMArena Instruction Following14751438

Long Context Too close to call

Claude Sonnet 4.6: 45.3 (#44), Qwen3.6 Max Preview: 44.6 (#61)

Long Context benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.6 Max Preview
LMArena Longer Query14791457

Writing & Preference Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 70.2 (#22), Qwen3.6 Max Preview: 63.8 (#60)

Writing & Preference benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.6 Max Preview
LMArena Text14581447
LMArena Creative Writing14351435
LMArena Multi-Turn14641456
EQ-Bench Creative Writing1810—
EQ-Bench 41207—

Frequently asked questions

Is Claude Sonnet 4.6 better than Qwen3.6 Max Preview?

Qwen3.6 Max Preview is the stronger model overall, scoring 51.5 to 50.3 on the Noometry Index.

Which is cheaper, Claude Sonnet 4.6 or Qwen3.6 Max Preview?

Qwen3.6 Max Preview is cheaper. It lists at $1.30 per million input tokens and $7.80 per million output tokens; Claude Sonnet 4.6 lists at $3 and $15.

Is Claude Sonnet 4.6 or Qwen3.6 Max Preview better for coding?

Qwen3.6 Max Preview scores higher on coding benchmarks: 48.7 versus 46.3 in the Noometry coding category.

Which has the bigger context window?

Claude Sonnet 4.6 does, with 1M tokens against 262K.

How many benchmarks do Claude Sonnet 4.6 and Qwen3.6 Max Preview share?

28 benchmarks have published results for both models. Claude Sonnet 4.6 has 57 scored results on Noometry and Qwen3.6 Max Preview has 29.

Related comparisons

Go deeper