Model comparison

Hunyuan T1 20250711 vs Mistral Medium

Hunyuan T1 20250711 is the stronger model overall, scoring 42.5 to 36.3 on the Noometry Index.

Last verified . 13 shared benchmarks.

Hunyuan T1 20250711 Tencent

42.5

Rank #114 Confirmed

Mistral Medium Mistral AI

36.3

Rank #218 Confirmed

Summary

  • They share 13 benchmarks with published results for both. Hunyuan T1 20250711 scores higher in 4 categories and Mistral Medium in 4 categories; 5 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Hunyuan T1 20250711 leads 38.8 to 25.0.
  • Mistral Medium has downloadable open weights; the other is API-only.

Side by side

Hunyuan T1 20250711 and Mistral Medium specifications
Hunyuan T1 20250711Mistral Medium
ProviderTencentMistral AI
Noometry Index42.536.3
Released—2023-12-11
WeightsProprietaryOpen
Context window—262K
Max output—262K
Input $ / M tokens—$1.50
Output $ / M tokens—$7.50
Results tracked1336

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Hunyuan T1 20250711 leads

Hunyuan T1 20250711: 40.9 (#129), Mistral Medium: 34.2 (#243)

Coding benchmarks
BenchmarkHunyuan T1 20250711Mistral Medium
LMArena Coding13901434
FrontierCode—8%
SciCode—40.2%
WeirdML—43.7%
ALE-Bench—763.98

Agentic & Tool Use Not comparable

Hunyuan T1 20250711: —, Mistral Medium: 28.3 (#90)

Agentic & Tool Use benchmarks
BenchmarkHunyuan T1 20250711Mistral Medium
Berkeley Function Calling Leaderboard—37.7%

Reasoning Hunyuan T1 20250711 leads

Hunyuan T1 20250711: 28.5 (#103), Mistral Medium: 24.0 (#167)

Reasoning benchmarks
BenchmarkHunyuan T1 20250711Mistral Medium
LMArena Hard Prompts13991426
Kagi LLM Benchmark—50%
CritPt—0%
DTBench—75.5%
LMCA—26.1%
Surface Evolver Bench—26.9%

Math Hunyuan T1 20250711 leads

Hunyuan T1 20250711: 38.7 (#130), Mistral Medium: 28.1 (#245)

Math benchmarks
BenchmarkHunyuan T1 20250711Mistral Medium
LMArena Math14141408
OTIS Mock AIME 2024-2025—32.2%
ProofBench—9%
MATH Level 5—81.6%
FrontierMath (Feb 2025 set)—0.3%

Knowledge Hunyuan T1 20250711 leads

Hunyuan T1 20250711: 38.8 (#141), Mistral Medium: 25.0 (#265)

Knowledge benchmarks
BenchmarkHunyuan T1 20250711Mistral Medium
LMArena Expert13951408
GPQA Diamond—59.5%
Humanity's Last Exam—4.5%
Vectara Hallucination Rate—22.7%

Multimodal Not comparable

Hunyuan T1 20250711: —, Mistral Medium: 35.3 (#88)

Multimodal benchmarks
BenchmarkHunyuan T1 20250711Mistral Medium
LMArena Vision—1172

Multilingual Too close to call

Hunyuan T1 20250711: 51.2 (#112), Mistral Medium: 52.1 (#91)

Multilingual benchmarks
BenchmarkHunyuan T1 20250711Mistral Medium
LMArena Non-English13951408
LMArena Chinese14251447
LMArena Korean14061380
LMArena Russian13851411
LMArena French—1459
LMArena German—1432
LMArena Japanese—1378
LMArena Spanish—1433

Instruction Following Mistral Medium leads

Hunyuan T1 20250711: 72.6 (#138), Mistral Medium: 73.7 (#116)

Instruction Following benchmarks
BenchmarkHunyuan T1 20250711Mistral Medium
LMArena Instruction Following13741398

Long Context Too close to call

Hunyuan T1 20250711: 42.2 (#128), Mistral Medium: 42.9 (#114)

Long Context benchmarks
BenchmarkHunyuan T1 20250711Mistral Medium
LMArena Longer Query13841406

Writing & Preference Too close to call

Hunyuan T1 20250711: 59.5 (#109), Mistral Medium: 60.0 (#103)

Writing & Preference benchmarks
BenchmarkHunyuan T1 20250711Mistral Medium
LMArena Text14011424
LMArena Creative Writing13921391
LMArena Multi-Turn13931418
Short-Story Creative Writing—77.3%

Frequently asked questions

Is Hunyuan T1 20250711 better than Mistral Medium?

Hunyuan T1 20250711 is the stronger model overall, scoring 42.5 to 36.3 on the Noometry Index.

Is Hunyuan T1 20250711 or Mistral Medium better for coding?

Hunyuan T1 20250711 scores higher on coding benchmarks: 40.9 versus 34.2 in the Noometry coding category.

How many benchmarks do Hunyuan T1 20250711 and Mistral Medium share?

13 benchmarks have published results for both models. Hunyuan T1 20250711 has 13 scored results on Noometry and Mistral Medium has 36.

Related comparisons

Go deeper