Model comparison
Amazon Nova Experimental Chat 12 10 vs Qwen3 235B-A22B
Amazon Nova Experimental Chat 12 10 and Qwen3 235B-A22B score almost the same on the Noometry Index (42.9 vs 43.5), so choose on price, context window or the category you care about most.
Last verified . 12 shared benchmarks.
Summary
- They share 12 benchmarks with published results for both. Amazon Nova Experimental Chat 12 10 scores higher in 2 categories and Qwen3 235B-A22B in 6 categories; 5 gaps are clear of the uncertainty.
- The widest gap is in reasoning, where Amazon Nova Experimental Chat 12 10 leads 29.3 to 15.7.
- Qwen3 235B-A22B has downloadable open weights; the other is API-only.
Side by side
| Amazon Nova Experimental Chat 12 10 | Qwen3 235B-A22B | |
|---|---|---|
| Provider | Amazon | Alibaba (Qwen) |
| Noometry Index | 42.9 | 43.5 |
| Released | — | 2025-04 |
| Weights | Proprietary | Open |
| Context window | — | 131K |
| Max output | — | 16K |
| Input $ / M tokens | — | $0.70 |
| Output $ / M tokens | — | $2.80 |
| Results tracked | 12 | 49 |
Sponsored placements are available on pages like this one. Advertise on Noometry
Category by category
Coding Qwen3 235B-A22B leads
Amazon Nova Experimental Chat 12 10: 42.2 (#110), Qwen3 235B-A22B: 44.3 (#75)
| Benchmark | Amazon Nova Experimental Chat 12 10 | Qwen3 235B-A22B |
|---|---|---|
| LMArena Coding | 1430 | 1445 |
| Aider Polyglot | — | 59.6% |
| SciCode | — | 42.4% |
| WeirdML | — | 41% |
Agentic & Tool Use Not comparable
Amazon Nova Experimental Chat 12 10: —, Qwen3 235B-A22B: 33.9 (#51)
| Benchmark | Amazon Nova Experimental Chat 12 10 | Qwen3 235B-A22B |
|---|---|---|
| Berkeley Function Calling Leaderboard | — | 52.1% |
| Vending-Bench 2 | — | -11.34 |
Reasoning Amazon Nova Experimental Chat 12 10 leads
Amazon Nova Experimental Chat 12 10: 29.3 (#94), Qwen3 235B-A22B: 15.7 (#311)
| Benchmark | Amazon Nova Experimental Chat 12 10 | Qwen3 235B-A22B |
|---|---|---|
| LMArena Hard Prompts | 1427 | 1433 |
| ARC-AGI-2 | — | 1.3% |
| SimpleBench | — | 31% |
| Kagi LLM Benchmark | — | 69.4% |
| ARC-AGI-1 | — | 11% |
| CritPt | — | 0% |
| Chess Puzzles | — | 12% |
| Mystery Game Puzzles | — | 9% |
| DTBench | — | 80.3% |
| LMCA | — | 29.3% |
| Epoch Capabilities Index | — | 143.85 |
| ForecastBench | — | 59.7 |
Math Qwen3 235B-A22B leads
Amazon Nova Experimental Chat 12 10: 38.9 (#124), Qwen3 235B-A22B: 50.4 (#57)
| Benchmark | Amazon Nova Experimental Chat 12 10 | Qwen3 235B-A22B |
|---|---|---|
| LMArena Math | 1419 | 1432 |
| OTIS Mock AIME 2024-2025 | — | 86.7% |
| Omni-MATH | — | 71.8% |
| MATH Level 5 | — | 68.9% |
| FrontierMath (Feb 2025 set) | — | 8.5% |
| FrontierMath Tier 4 (v1) | — | 0% |
Knowledge Qwen3 235B-A22B leads
Amazon Nova Experimental Chat 12 10: 39.2 (#136), Qwen3 235B-A22B: 49.6 (#73)
| Benchmark | Amazon Nova Experimental Chat 12 10 | Qwen3 235B-A22B |
|---|---|---|
| LMArena Expert | 1408 | 1463 |
| GPQA Diamond | — | 80.1% |
| SimpleQA Verified | — | 40.4% |
| MMLU-Pro | — | 84.4% |
| Confabulations | — | 15.6% |
| Vectara Hallucination Rate | — | 9.3% |
| GPQA (HELM) | — | 72.7% |
Multilingual Too close to call
Amazon Nova Experimental Chat 12 10: 51.4 (#108), Qwen3 235B-A22B: 52.3 (#89)
| Benchmark | Amazon Nova Experimental Chat 12 10 | Qwen3 235B-A22B |
|---|---|---|
| LMArena Non-English | 1398 | 1409 |
| LMArena Chinese | 1440 | 1481 |
| LMArena Russian | 1395 | 1411 |
| LMArena French | — | 1445 |
| LMArena German | — | 1433 |
| LMArena Japanese | — | 1399 |
| LMArena Korean | — | 1391 |
| LMArena Spanish | — | 1430 |
Instruction Following Too close to call
Amazon Nova Experimental Chat 12 10: 73.2 (#123), Qwen3 235B-A22B: 72.6 (#136)
| Benchmark | Amazon Nova Experimental Chat 12 10 | Qwen3 235B-A22B |
|---|---|---|
| LMArena Instruction Following | 1387 | 1408 |
| IFEval | — | 83.5% |
Long Context Qwen3 235B-A22B leads
Amazon Nova Experimental Chat 12 10: 42.4 (#125), Qwen3 235B-A22B: 46.1 (#26)
| Benchmark | Amazon Nova Experimental Chat 12 10 | Qwen3 235B-A22B |
|---|---|---|
| LMArena Longer Query | 1391 | 1426 |
| Fiction.LiveBench | — | 75% |
Writing & Preference Too close to call
Amazon Nova Experimental Chat 12 10: 59.5 (#110), Qwen3 235B-A22B: 59.6 (#108)
| Benchmark | Amazon Nova Experimental Chat 12 10 | Qwen3 235B-A22B |
|---|---|---|
| LMArena Text | 1420 | 1419 |
| LMArena Creative Writing | 1350 | 1384 |
| LMArena Multi-Turn | 1409 | 1432 |
| Short-Story Creative Writing | — | 83% |
| EQ-Bench Creative Writing | — | 1366 |
| WildBench | — | 86.6% |
Frequently asked questions
Is Amazon Nova Experimental Chat 12 10 better than Qwen3 235B-A22B?
Amazon Nova Experimental Chat 12 10 and Qwen3 235B-A22B score almost the same on the Noometry Index (42.9 vs 43.5), so choose on price, context window or the category you care about most.
Is Amazon Nova Experimental Chat 12 10 or Qwen3 235B-A22B better for coding?
Qwen3 235B-A22B scores higher on coding benchmarks: 44.3 versus 42.2 in the Noometry coding category.
How many benchmarks do Amazon Nova Experimental Chat 12 10 and Qwen3 235B-A22B share?
12 benchmarks have published results for both models. Amazon Nova Experimental Chat 12 10 has 12 scored results on Noometry and Qwen3 235B-A22B has 49.