Model comparison

Amazon Nova Experimental Chat 12 10 vs Qwen3 235B-A22B

Amazon Nova Experimental Chat 12 10 and Qwen3 235B-A22B score almost the same on the Noometry Index (42.9 vs 43.5), so choose on price, context window or the category you care about most.

Last verified . 12 shared benchmarks.

Qwen3 235B-A22B Alibaba (Qwen)

43.5

Rank #91 Confirmed

Summary

  • They share 12 benchmarks with published results for both. Amazon Nova Experimental Chat 12 10 scores higher in 2 categories and Qwen3 235B-A22B in 6 categories; 5 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Amazon Nova Experimental Chat 12 10 leads 29.3 to 15.7.
  • Qwen3 235B-A22B has downloadable open weights; the other is API-only.

Side by side

Amazon Nova Experimental Chat 12 10 and Qwen3 235B-A22B specifications
Amazon Nova Experimental Chat 12 10Qwen3 235B-A22B
ProviderAmazonAlibaba (Qwen)
Noometry Index42.943.5
Released—2025-04
WeightsProprietaryOpen
Context window—131K
Max output—16K
Input $ / M tokens—$0.70
Output $ / M tokens—$2.80
Results tracked1249

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Qwen3 235B-A22B leads

Amazon Nova Experimental Chat 12 10: 42.2 (#110), Qwen3 235B-A22B: 44.3 (#75)

Coding benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10Qwen3 235B-A22B
LMArena Coding14301445
Aider Polyglot—59.6%
SciCode—42.4%
WeirdML—41%

Agentic & Tool Use Not comparable

Amazon Nova Experimental Chat 12 10: —, Qwen3 235B-A22B: 33.9 (#51)

Agentic & Tool Use benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10Qwen3 235B-A22B
Berkeley Function Calling Leaderboard—52.1%
Vending-Bench 2—-11.34

Reasoning Amazon Nova Experimental Chat 12 10 leads

Amazon Nova Experimental Chat 12 10: 29.3 (#94), Qwen3 235B-A22B: 15.7 (#311)

Reasoning benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10Qwen3 235B-A22B
LMArena Hard Prompts14271433
ARC-AGI-2—1.3%
SimpleBench—31%
Kagi LLM Benchmark—69.4%
ARC-AGI-1—11%
CritPt—0%
Chess Puzzles—12%
Mystery Game Puzzles—9%
DTBench—80.3%
LMCA—29.3%
Epoch Capabilities Index—143.85
ForecastBench—59.7

Math Qwen3 235B-A22B leads

Amazon Nova Experimental Chat 12 10: 38.9 (#124), Qwen3 235B-A22B: 50.4 (#57)

Math benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10Qwen3 235B-A22B
LMArena Math14191432
OTIS Mock AIME 2024-2025—86.7%
Omni-MATH—71.8%
MATH Level 5—68.9%
FrontierMath (Feb 2025 set)—8.5%
FrontierMath Tier 4 (v1)—0%

Knowledge Qwen3 235B-A22B leads

Amazon Nova Experimental Chat 12 10: 39.2 (#136), Qwen3 235B-A22B: 49.6 (#73)

Knowledge benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10Qwen3 235B-A22B
LMArena Expert14081463
GPQA Diamond—80.1%
SimpleQA Verified—40.4%
MMLU-Pro—84.4%
Confabulations—15.6%
Vectara Hallucination Rate—9.3%
GPQA (HELM)—72.7%

Multilingual Too close to call

Amazon Nova Experimental Chat 12 10: 51.4 (#108), Qwen3 235B-A22B: 52.3 (#89)

Multilingual benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10Qwen3 235B-A22B
LMArena Non-English13981409
LMArena Chinese14401481
LMArena Russian13951411
LMArena French—1445
LMArena German—1433
LMArena Japanese—1399
LMArena Korean—1391
LMArena Spanish—1430

Instruction Following Too close to call

Amazon Nova Experimental Chat 12 10: 73.2 (#123), Qwen3 235B-A22B: 72.6 (#136)

Instruction Following benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10Qwen3 235B-A22B
LMArena Instruction Following13871408
IFEval—83.5%

Long Context Qwen3 235B-A22B leads

Amazon Nova Experimental Chat 12 10: 42.4 (#125), Qwen3 235B-A22B: 46.1 (#26)

Long Context benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10Qwen3 235B-A22B
LMArena Longer Query13911426
Fiction.LiveBench—75%

Writing & Preference Too close to call

Amazon Nova Experimental Chat 12 10: 59.5 (#110), Qwen3 235B-A22B: 59.6 (#108)

Writing & Preference benchmarks
BenchmarkAmazon Nova Experimental Chat 12 10Qwen3 235B-A22B
LMArena Text14201419
LMArena Creative Writing13501384
LMArena Multi-Turn14091432
Short-Story Creative Writing—83%
EQ-Bench Creative Writing—1366
WildBench—86.6%

Frequently asked questions

Is Amazon Nova Experimental Chat 12 10 better than Qwen3 235B-A22B?

Amazon Nova Experimental Chat 12 10 and Qwen3 235B-A22B score almost the same on the Noometry Index (42.9 vs 43.5), so choose on price, context window or the category you care about most.

Is Amazon Nova Experimental Chat 12 10 or Qwen3 235B-A22B better for coding?

Qwen3 235B-A22B scores higher on coding benchmarks: 44.3 versus 42.2 in the Noometry coding category.

How many benchmarks do Amazon Nova Experimental Chat 12 10 and Qwen3 235B-A22B share?

12 benchmarks have published results for both models. Amazon Nova Experimental Chat 12 10 has 12 scored results on Noometry and Qwen3 235B-A22B has 49.

Related comparisons

Go deeper