Model comparison

Claude Sonnet 4.6 vs Qwen3.5-Flash

Claude Sonnet 4.6 is the stronger model overall, scoring 50.3 to 42.5 on the Noometry Index. Qwen3.5-Flash costs 34× less per token, which makes it the better buy when Claude Sonnet 4.6's lead doesn't matter for your workload.

Last verified . 31 shared benchmarks.

Claude Sonnet 4.6 Anthropic

50.3

Rank #50 Confirmed

Qwen3.5-Flash Alibaba (Qwen)

42.5

Rank #112 Confirmed

Summary

  • They share 31 benchmarks with published results for both. Claude Sonnet 4.6 scores higher in 8 categories and Qwen3.5-Flash in 0 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Claude Sonnet 4.6 leads 52.9 to 37.4.
  • The biggest single-benchmark swing is LMCA: 46.5% for Claude Sonnet 4.6 and 29.1% for Qwen3.5-Flash.
  • Qwen3.5-Flash is cheaper at $0.10 / $0.40 per million input/output tokens, against $3 / $15 for Claude Sonnet 4.6.

Side by side

Claude Sonnet 4.6 and Qwen3.5-Flash specifications
Claude Sonnet 4.6Qwen3.5-Flash
ProviderAnthropicAlibaba (Qwen)
Noometry Index50.342.5
Released2026-02-172026-02-23
WeightsProprietaryProprietary
Context window1M1M
Max output128K66K
Input $ / M tokens$3$0.10
Output $ / M tokens$15$0.40
Results tracked5732

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 46.3 (#67), Qwen3.5-Flash: 34.2 (#242)

Coding benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.5-Flash
LMArena WebDev15221244
LMArena Coding15041412
ALE-Bench1,327221.8
SWE-bench Verified75.2%—
DeepSWE29.9%—
FrontierCode24.3%—
SciCode46.8%—
WeirdML66.1%—

Agentic & Tool Use Not comparable

Claude Sonnet 4.6: 39.1 (#28), Qwen3.5-Flash: —

Agentic & Tool Use benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.5-Flash
Vending-Bench 27,204462.69
Terminal-Bench53.4%—
APEX-Agents43%—
OSWorld 2.09.3%—
DeepResearch Bench54.9%—
OSWorld72.1%—
ExploitBench23.6%—
GBAEval48.8%—
GDP.pdf18%—
LMArena Search1221—

Reasoning Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 46.1 (#45), Qwen3.5-Flash: 33.7 (#72)

Reasoning benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.5-Flash
Chess Puzzles13%21%
LMArena Hard Prompts14841403
Mystery Game Puzzles16%20%
DTBench89.9%82.9%
LMCA46.5%29.1%
Epoch Capabilities Index152.24143.98
ARC-AGI-260.4%—
NYT Connections (extended)80.9%—
ARC-AGI-186.5%—
CritPt3.1%—
Thematic Generalization76.3%—
ForecastBench62—

Math Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 52.9 (#49), Qwen3.5-Flash: 37.4 (#158)

Math benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.5-Flash
OTIS Mock AIME 2024-202585.8%84.4%
LMArena Math14621407
FrontierMath (Feb 2025 set)32.4%6.2%
FrontierMath Tier 4 (v1)8.3%0%
FrontierMath (Tiers 1-3)—18.2%
ProofBench45%—

Knowledge Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 51.7 (#65), Qwen3.5-Flash: 43.2 (#93)

Knowledge benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.5-Flash
GPQA Diamond87.4%82.3%
SimpleQA Verified35.5%20.3%
Vectara Hallucination Rate10.6%10.5%
LMArena Expert15001407

Multimodal Not comparable

Claude Sonnet 4.6: 38.0 (#68), Qwen3.5-Flash: —

Multimodal benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.5-Flash
LMArena Vision1283—
Blueprint-Bench 26.7%—
LMArena Document1482—

Multilingual Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 54.4 (#41), Qwen3.5-Flash: 50.5 (#121)

Multilingual benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.5-Flash
LMArena Non-English14401385
LMArena Chinese14911446
LMArena French14651412
LMArena German14281390
LMArena Japanese14201368
LMArena Korean14111344
LMArena Russian14401379
LMArena Spanish14641400

Instruction Following Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 77.4 (#25), Qwen3.5-Flash: 72.6 (#139)

Instruction Following benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.5-Flash
LMArena Instruction Following14751374

Long Context Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 45.3 (#44), Qwen3.5-Flash: 42.4 (#124)

Long Context benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.5-Flash
LMArena Longer Query14791392

Writing & Preference Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 70.2 (#22), Qwen3.5-Flash: 57.9 (#122)

Writing & Preference benchmarks
BenchmarkClaude Sonnet 4.6Qwen3.5-Flash
LMArena Text14581397
LMArena Creative Writing14351343
LMArena Multi-Turn14641393
EQ-Bench Creative Writing1810—
EQ-Bench 41207—

Frequently asked questions

Is Claude Sonnet 4.6 better than Qwen3.5-Flash?

Claude Sonnet 4.6 is the stronger model overall, scoring 50.3 to 42.5 on the Noometry Index. Qwen3.5-Flash costs 34× less per token, which makes it the better buy when Claude Sonnet 4.6's lead doesn't matter for your workload.

Which is cheaper, Claude Sonnet 4.6 or Qwen3.5-Flash?

Qwen3.5-Flash is cheaper. It lists at $0.10 per million input tokens and $0.40 per million output tokens; Claude Sonnet 4.6 lists at $3 and $15.

Is Claude Sonnet 4.6 or Qwen3.5-Flash better for coding?

Claude Sonnet 4.6 scores higher on coding benchmarks: 46.3 versus 34.2 in the Noometry coding category.

Which has the bigger context window?

Both accept 1M tokens.

How many benchmarks do Claude Sonnet 4.6 and Qwen3.5-Flash share?

31 benchmarks have published results for both models. Claude Sonnet 4.6 has 57 scored results on Noometry and Qwen3.5-Flash has 32.

Related comparisons

Go deeper