Model comparison

C4ai Aya Expanse 8b vs Claude Sonnet 4

Claude Sonnet 4 is the stronger model overall, scoring 40.8 to 34.9 on the Noometry Index.

Last verified . 15 shared benchmarks.

C4ai Aya Expanse 8b Cohere

34.9

Rank #229 Confirmed

Claude Sonnet 4 Anthropic

40.8

Rank #145 Confirmed

Summary

  • They share 15 benchmarks with published results for both. C4ai Aya Expanse 8b scores higher in 1 category and Claude Sonnet 4 in 7 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Claude Sonnet 4 leads 57.1 to 39.0.
  • C4ai Aya Expanse 8b has downloadable open weights; the other is API-only.

Side by side

C4ai Aya Expanse 8b and Claude Sonnet 4 specifications
C4ai Aya Expanse 8bClaude Sonnet 4
ProviderCohereAnthropic
Noometry Index34.940.8
Released—2025-05-22
WeightsOpenProprietary
Context window—200K
Max output—64K
Input $ / M tokens—$3
Output $ / M tokens—$15
Results tracked1558

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 4 leads

C4ai Aya Expanse 8b: 33.8 (#252), Claude Sonnet 4: 43.5 (#88)

Coding benchmarks
BenchmarkC4ai Aya Expanse 8bClaude Sonnet 4
LMArena Coding11601414
SWE-bench Verified (bash only)—64.9%
Aider Polyglot—61.3%
SciCode—40%
GSO—4.9%
WeirdML—46.1%
ALE-Bench—655.35

Agentic & Tool Use Not comparable

C4ai Aya Expanse 8b: —, Claude Sonnet 4: 38.5 (#31)

Agentic & Tool Use benchmarks
BenchmarkC4ai Aya Expanse 8bClaude Sonnet 4
TheAgentCompany—33.1%
Cybench—35%
DeepResearch Bench—46.6%
OSWorld—43.9%
METR Time Horizons—62%

Reasoning Too close to call

C4ai Aya Expanse 8b: 22.4 (#197), Claude Sonnet 4: 22.9 (#187)

Reasoning benchmarks
BenchmarkC4ai Aya Expanse 8bClaude Sonnet 4
LMArena Hard Prompts11561372
ARC-AGI-2—5.9%
SimpleBench—45.5%
Kagi LLM Benchmark—73%
ARC-AGI-1—40%
CritPt—0.3%
EnigmaEval—3.1%
DTBench—77.1%
LMCA—29%
Epoch Capabilities Index—141.69
ForecastBench—60.2

Math Claude Sonnet 4 leads

C4ai Aya Expanse 8b: 33.3 (#203), Claude Sonnet 4: 43.3 (#80)

Math benchmarks
BenchmarkC4ai Aya Expanse 8bClaude Sonnet 4
LMArena Math11681375
OTIS Mock AIME 2024-2025—71.1%
Omni-MATH—60.2%
MATH Level 5—84.4%
FrontierMath (Feb 2025 set)—4.1%
FrontierMath Tier 4 (v1)—0%

Knowledge Claude Sonnet 4 leads

C4ai Aya Expanse 8b: 33.6 (#201), Claude Sonnet 4: 41.8 (#108)

Knowledge benchmarks
BenchmarkC4ai Aya Expanse 8bClaude Sonnet 4
Vectara Hallucination Rate9.5%10.3%
LMArena Expert11531372
GPQA Diamond—79.2%
Humanity's Last Exam—7.8%
MMLU-Pro—84.3%
Confabulations—13.2%
GPQA (HELM)—70.6%

Multimodal Not comparable

C4ai Aya Expanse 8b: —, Claude Sonnet 4: 26.2 (#121)

Multimodal benchmarks
BenchmarkC4ai Aya Expanse 8bClaude Sonnet 4
LMArena Vision—1191
GeoBench—37%
VPCT—34%
MindCube—44.8%

Multilingual Claude Sonnet 4 leads

C4ai Aya Expanse 8b: 36.1 (#242), Claude Sonnet 4: 46.7 (#156)

Multilingual benchmarks
BenchmarkC4ai Aya Expanse 8bClaude Sonnet 4
LMArena Non-English11801333
LMArena Chinese11811350
LMArena German11881331
LMArena Japanese11201302
LMArena Russian11971355
LMArena French—1363
LMArena Korean—1291
LMArena Spanish—1357

Instruction Following Claude Sonnet 4 leads

C4ai Aya Expanse 8b: 60.1 (#253), Claude Sonnet 4: 71.7 (#145)

Instruction Following benchmarks
BenchmarkC4ai Aya Expanse 8bClaude Sonnet 4
LMArena Instruction Following11551376
IFEval—84%

Long Context C4ai Aya Expanse 8b leads

C4ai Aya Expanse 8b: 36.1 (#236), Claude Sonnet 4: 33.7 (#259)

Long Context benchmarks
BenchmarkC4ai Aya Expanse 8bClaude Sonnet 4
LMArena Longer Query11911398
Fiction.LiveBench—46.9%

Writing & Preference Claude Sonnet 4 leads

C4ai Aya Expanse 8b: 39.0 (#250), Claude Sonnet 4: 57.1 (#132)

Writing & Preference benchmarks
BenchmarkC4ai Aya Expanse 8bClaude Sonnet 4
LMArena Text11851351
LMArena Creative Writing11681345
LMArena Multi-Turn11601376
Short-Story Creative Writing—81.4%
EQ-Bench Creative Writing—1483
WildBench—83.8%

Frequently asked questions

Is C4ai Aya Expanse 8b better than Claude Sonnet 4?

Claude Sonnet 4 is the stronger model overall, scoring 40.8 to 34.9 on the Noometry Index.

Is C4ai Aya Expanse 8b or Claude Sonnet 4 better for coding?

Claude Sonnet 4 scores higher on coding benchmarks: 43.5 versus 33.8 in the Noometry coding category.

How many benchmarks do C4ai Aya Expanse 8b and Claude Sonnet 4 share?

15 benchmarks have published results for both models. C4ai Aya Expanse 8b has 15 scored results on Noometry and Claude Sonnet 4 has 58.

Related comparisons

Go deeper