Model comparison

Amazon Nova Experimental Chat 11 10 vs Qwen3 235B-A22B

Amazon Nova Experimental Chat 11 10 and Qwen3 235B-A22B score almost the same on the Noometry Index (43.0 vs 43.5), so choose on price, context window or the category you care about most.

Last verified . 17 shared benchmarks.

Qwen3 235B-A22B Alibaba (Qwen)

43.5

Rank #91 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Amazon Nova Experimental Chat 11 10 scores higher in 2 categories and Qwen3 235B-A22B in 6 categories; 5 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Amazon Nova Experimental Chat 11 10 leads 29.1 to 15.7.
  • Qwen3 235B-A22B has downloadable open weights; the other is API-only.

Side by side

Amazon Nova Experimental Chat 11 10 and Qwen3 235B-A22B specifications
Amazon Nova Experimental Chat 11 10Qwen3 235B-A22B
ProviderAmazonAlibaba (Qwen)
Noometry Index43.043.5
Released—2025-04
WeightsProprietaryOpen
Context window—131K
Max output—16K
Input $ / M tokens—$0.70
Output $ / M tokens—$2.80
Results tracked1749

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Qwen3 235B-A22B leads

Amazon Nova Experimental Chat 11 10: 42.3 (#107), Qwen3 235B-A22B: 44.3 (#75)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Qwen3 235B-A22B
LMArena Coding14331445
Aider Polyglot—59.6%
SciCode—42.4%
WeirdML—41%

Agentic & Tool Use Not comparable

Amazon Nova Experimental Chat 11 10: —, Qwen3 235B-A22B: 33.9 (#51)

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Qwen3 235B-A22B
Berkeley Function Calling Leaderboard—52.1%
Vending-Bench 2—-11.34

Reasoning Amazon Nova Experimental Chat 11 10 leads

Amazon Nova Experimental Chat 11 10: 29.1 (#95), Qwen3 235B-A22B: 15.7 (#311)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Qwen3 235B-A22B
LMArena Hard Prompts14221433
ARC-AGI-2—1.3%
SimpleBench—31%
Kagi LLM Benchmark—69.4%
ARC-AGI-1—11%
CritPt—0%
Chess Puzzles—12%
Mystery Game Puzzles—9%
DTBench—80.3%
LMCA—29.3%
Epoch Capabilities Index—143.85
ForecastBench—59.7

Math Qwen3 235B-A22B leads

Amazon Nova Experimental Chat 11 10: 39.1 (#114), Qwen3 235B-A22B: 50.4 (#57)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Qwen3 235B-A22B
LMArena Math14311432
OTIS Mock AIME 2024-2025—86.7%
Omni-MATH—71.8%
MATH Level 5—68.9%
FrontierMath (Feb 2025 set)—8.5%
FrontierMath Tier 4 (v1)—0%

Knowledge Qwen3 235B-A22B leads

Amazon Nova Experimental Chat 11 10: 39.9 (#127), Qwen3 235B-A22B: 49.6 (#73)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Qwen3 235B-A22B
LMArena Expert14311463
GPQA Diamond—80.1%
SimpleQA Verified—40.4%
MMLU-Pro—84.4%
Confabulations—15.6%
Vectara Hallucination Rate—9.3%
GPQA (HELM)—72.7%

Multilingual Too close to call

Amazon Nova Experimental Chat 11 10: 51.9 (#98), Qwen3 235B-A22B: 52.3 (#89)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Qwen3 235B-A22B
LMArena Non-English14051409
LMArena Chinese14631481
LMArena French14491445
LMArena German13951433
LMArena Japanese13831399
LMArena Korean13841391
LMArena Russian13941411
LMArena Spanish14441430

Instruction Following Too close to call

Amazon Nova Experimental Chat 11 10: 73.2 (#122), Qwen3 235B-A22B: 72.6 (#136)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Qwen3 235B-A22B
LMArena Instruction Following13871408
IFEval—83.5%

Long Context Qwen3 235B-A22B leads

Amazon Nova Experimental Chat 11 10: 42.5 (#121), Qwen3 235B-A22B: 46.1 (#26)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Qwen3 235B-A22B
LMArena Longer Query13951426
Fiction.LiveBench—75%

Writing & Preference Too close to call

Amazon Nova Experimental Chat 11 10: 58.8 (#114), Qwen3 235B-A22B: 59.6 (#108)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 11 10Qwen3 235B-A22B
LMArena Text14151419
LMArena Creative Writing13491384
LMArena Multi-Turn13801432
Short-Story Creative Writing—83%
EQ-Bench Creative Writing—1366
WildBench—86.6%

Frequently asked questions

Is Amazon Nova Experimental Chat 11 10 better than Qwen3 235B-A22B?

Amazon Nova Experimental Chat 11 10 and Qwen3 235B-A22B score almost the same on the Noometry Index (43.0 vs 43.5), so choose on price, context window or the category you care about most.

Is Amazon Nova Experimental Chat 11 10 or Qwen3 235B-A22B better for coding?

Qwen3 235B-A22B scores higher on coding benchmarks: 44.3 versus 42.3 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 11 10 and Qwen3 235B-A22B share?

17 benchmarks have published results for both models. Amazon Nova Experimental Chat 11 10 has 17 scored results on Noometry and Qwen3 235B-A22B has 49.

Related comparisons

Go deeper