# Amazon Nova Experimental Chat 11 10 vs Grok 4.6

> Grok 4.6 is the stronger model overall, scoring 56.9 to 43.0 on the Noometry Index.

- Canonical page: https://noometry.com/compare/amazon-nova-experimental-chat-11-10-vs-grok-4-6
- Last updated: 2026-10-10
- Shared benchmarks: 17

## Summary

- They share 17 benchmarks with published results for both. Amazon Nova Experimental Chat 11 10 scores higher in 0 categories and Grok 4.6 in 8 categories; 8 gaps are clear of the uncertainty.
- The widest gap is in reasoning, where Grok 4.6 leads 61.4 to 29.1.

## Snapshot

| | Amazon Nova Experimental Chat 11 10 | Grok 4.6 |
|---|---|---|
| Provider | Amazon | xAI |
| Noometry Index | 43.0 | 56.9 |
| Rank | 101 | 21 |
| Context | — | 500K |
| Input $/M | — | $2 |
| Output $/M | — | $6 |
| Weights | Proprietary | Proprietary |

## Coding

- Amazon Nova Experimental Chat 11 10: 42.3 (#107)
- Grok 4.6: 58.5 (#16)

| Benchmark | Amazon Nova Experimental Chat 11 10 | Grok 4.6 |
|---|---|---|
| LMArena Coding | 1433 | 1465 |
| DeepSWE | — | 67.5% |
| FrontierCode | — | 48% |
| CursorBench | — | 41.4% |
| LMArena WebDev | — | 1617 |
| FrontierSWE | — | 25.3% |
| SciCode | — | 56.5% |
| WeirdML | — | 67.3% |
| ALE-Bench | — | 1,508 |

## Agentic & Tool Use

- Amazon Nova Experimental Chat 11 10: —
- Grok 4.6: 39.4 (#27)

| Benchmark | Amazon Nova Experimental Chat 11 10 | Grok 4.6 |
|---|---|---|
| APEX-Agents | — | 65.3% |
| GDP.pdf | — | 17.2% |
| Vending-Bench 2 | — | 9,047 |

## Reasoning

- Amazon Nova Experimental Chat 11 10: 29.1 (#95)
- Grok 4.6: 61.4 (#20)

| Benchmark | Amazon Nova Experimental Chat 11 10 | Grok 4.6 |
|---|---|---|
| LMArena Hard Prompts | 1422 | 1447 |
| ARC-AGI-2 | — | 67.1% |
| SimpleBench | — | 75.9% |
| NYT Connections (extended) | — | 80% |
| ARC-AGI-1 | — | 87.5% |
| CritPt | — | 19.7% |
| Chess Puzzles | — | 40% |
| EBR-Bench | — | 30.5% |
| Mystery Game Puzzles | — | 34% |
| DTBench | — | 97.3% |
| LMCA | — | 48.5% |
| Epoch Capabilities Index | — | 156.44 |

## Math

- Amazon Nova Experimental Chat 11 10: 39.1 (#114)
- Grok 4.6: 67.0 (#24)

| Benchmark | Amazon Nova Experimental Chat 11 10 | Grok 4.6 |
|---|---|---|
| LMArena Math | 1431 | 1423 |
| FrontierMath (Tiers 1-3) | — | 66% |
| FrontierMath Tier 4 | — | 31.7% |
| OTIS Mock AIME 2024-2025 | — | 99.2% |
| ProofBench | — | 51% |

## Knowledge

- Amazon Nova Experimental Chat 11 10: 39.9 (#127)
- Grok 4.6: 63.3 (#20)

| Benchmark | Amazon Nova Experimental Chat 11 10 | Grok 4.6 |
|---|---|---|
| LMArena Expert | 1431 | 1467 |
| GPQA Diamond | — | 94% |
| SimpleQA Verified | — | 49.3% |

## Multimodal

- Amazon Nova Experimental Chat 11 10: —
- Grok 4.6: 43.6 (#23)

| Benchmark | Amazon Nova Experimental Chat 11 10 | Grok 4.6 |
|---|---|---|
| LMArena Vision | — | 1263 |
| Blueprint-Bench 2 | — | 33.2% |
| Furniture Assembly | — | 40% |
| LMArena Document | — | 1452 |

## Multilingual

- Amazon Nova Experimental Chat 11 10: 51.9 (#98)
- Grok 4.6: 53.0 (#74)

| Benchmark | Amazon Nova Experimental Chat 11 10 | Grok 4.6 |
|---|---|---|
| LMArena Non-English | 1405 | 1420 |
| LMArena Chinese | 1463 | 1480 |
| LMArena French | 1449 | 1461 |
| LMArena German | 1395 | 1431 |
| LMArena Japanese | 1383 | 1376 |
| LMArena Korean | 1384 | 1397 |
| LMArena Russian | 1394 | 1422 |
| LMArena Spanish | 1444 | 1404 |

## Instruction Following

- Amazon Nova Experimental Chat 11 10: 73.2 (#122)
- Grok 4.6: 75.4 (#63)

| Benchmark | Amazon Nova Experimental Chat 11 10 | Grok 4.6 |
|---|---|---|
| LMArena Instruction Following | 1387 | 1431 |

## Long Context

- Amazon Nova Experimental Chat 11 10: 42.5 (#121)
- Grok 4.6: 44.5 (#66)

| Benchmark | Amazon Nova Experimental Chat 11 10 | Grok 4.6 |
|---|---|---|
| LMArena Longer Query | 1395 | 1454 |

## Writing & Preference

- Amazon Nova Experimental Chat 11 10: 58.8 (#114)
- Grok 4.6: 62.3 (#80)

| Benchmark | Amazon Nova Experimental Chat 11 10 | Grok 4.6 |
|---|---|---|
| LMArena Text | 1415 | 1428 |
| LMArena Creative Writing | 1349 | 1428 |
| LMArena Multi-Turn | 1380 | 1425 |

## FAQ

### Is Amazon Nova Experimental Chat 11 10 better than Grok 4.6?

Grok 4.6 is the stronger model overall, scoring 56.9 to 43.0 on the Noometry Index.

### Is Amazon Nova Experimental Chat 11 10 or Grok 4.6 better for coding?

Grok 4.6 scores higher on coding benchmarks: 58.5 versus 42.3 in the Noometry coding category.

### How many benchmarks do Amazon Nova Experimental Chat 11 10 and Grok 4.6 share?

17 benchmarks have published results for both models. Amazon Nova Experimental Chat 11 10 has 17 scored results on Noometry and Grok 4.6 has 49.
