Évaluations indépendantes¶
Les seuls chiffres qui ne viennent pas d'Alibaba — et le seul endroit où figure ce que coûte réellement une tâche.
Artificial Analysis¶
Artificial Analysis exécute un ensemble fixe d'évaluations sur tous les modèles, dans des conditions identiques, et publie sa méthodologie. C'est la référence la plus utile disponible.
L'indice d'intelligence¶
| Mesure | Valeur |
|---|---|
| Indice d'intelligence | 58 |
| Rang | 10ᵉ sur 184 modèles |
L'indice agrège neuf évaluations : GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR.
Positionnement rapporté : à hauteur de Claude Opus 4.8, devant tous les modèles de Google, Meta et xAI, derrière les offres de tête d'Anthropic et d'OpenAI — et derrière Kimi K3.
Une valeur qui a bougé
Les premiers relevés publiés donnaient 56, les suivants 58. Un changement de configuration d'évaluation ou une mise à jour côté service peut expliquer l'écart. C'est un rappel utile : même les indices indépendants ne sont pas des constantes.
La vitesse — le chiffre le plus important¶
| Mesure | Qwen3.8-Max | Médiane de la catégorie |
|---|---|---|
| Vitesse de sortie | 47,0 jetons/s | 67,7 jetons/s |
| Rang en vitesse | 119ᵉ sur 184 | — |
| Délai au premier jeton | 2,72 s | — |
Le modèle est lent, et cela compte plus que deux points de benchmark
47 jetons par seconde, contre une médiane de 67,7. Le modèle est dans le dernier tiers du classement de vitesse.
Sur une tâche agentique de 200 tours avec raisonnement xhigh — donc des
dizaines de milliers de jetons invisibles par tour — cet écart de 30 % se
traduit en heures d'attente.
Trois causes se cumulent :
- Le raisonnement forcé à
xhighproduit énormément de jetons. - La bande passante mémoire : 95 G de paramètres actifs à recharger par jeton (voir Quantification et matériel).
- La communication all-to-all du routage MoE, 92 fois par passe.
Le coût réel¶
| Mesure | Valeur |
|---|---|
| Prix affiché (entrée / sortie) | 2,00 $ / 6,00 $ |
| Prix mélangé (ratio 7:2:1 cache / entrée / sortie) | 1,18 $ par million |
| Coût par tâche | 1,13 $ — 58ᵉ sur 184 |
Le coût par tâche est la seule métrique honnête
Le prix affiché ne dit rien tant qu'on ne sait pas combien de jetons le modèle consomme pour accomplir quelque chose. Un modèle à 1 $ le million qui réfléchit dix fois plus longtemps coûte plus cher qu'un modèle à 5 $.
À 1,13 $ par tâche, Qwen3.8-Max se place au 58ᵉ rang sur 184 — bon, mais
pas exceptionnel. Le raisonnement xhigh mange une bonne part de l'avantage
tarifaire.
Vals AI¶
| Mesure | Valeur |
|---|---|
| Vals Index | 66,1 % |
| Coût estimé par test | 2,68 $ |
| Latence d'évaluation | ~2 760 s |
Positionnement rapporté : 2ᵉ parmi les modèles à poids ouverts, 10ᵉ toutes catégories.
La latence de 2 760 secondes — 46 minutes pour une passe d'évaluation — confirme indépendamment le constat de lenteur.
LMArena¶
Classements par vote humain en comparaison aveugle.
| Arène | Rang | Score |
|---|---|---|
| Text Arena | 5ᵉ | — |
| Vision Arena | 2ᵉ | 1 305 |
| Frontend Code Arena | 4ᵉ | 1 668 Elo |
Le rang en Vision Arena ne concerne pas les poids ouverts
LMArena teste ce qui est servi par l'API. L'API qwen3.8-max accepte les
images ; le checkpoint Qwen3.8-2.4T-A95B non.
Toute mention de ce 2ᵉ rang comme propriété du modèle ouvert est une erreur. Voir Licence et disponibilité.
Au lancement, le modèle est devenu le modèle chinois le mieux classé en Text Arena.
Ce que mesure une arène de votes
Les préférences humaines en comparaison rapide favorisent les réponses longues, bien formatées, assertives. Elles corrèlent imparfaitement avec la justesse.
Un bon classement en arène indique un modèle agréable à utiliser. Ce n'est pas la même chose qu'un modèle fiable.
Synthèse¶
| Source | Nature | Résultat |
|---|---|---|
| Artificial Analysis | mesure standardisée | indice 58, 10ᵉ/184 |
| Artificial Analysis | vitesse | 47 j/s, 119ᵉ/184 |
| Artificial Analysis | coût par tâche | 1,13 $, 58ᵉ/184 |
| Vals AI | mesure standardisée | 66,1 %, 2ᵉ des ouverts |
| LMArena | préférence humaine | 5ᵉ texte, 4ᵉ front-end |
Le tableau convergent :
Ce que disent les tiers
Qwen3.8-Max est un modèle de niveau frontière, dans le premier vingtième mondial en capacité, le meilleur ou presque parmi les modèles à poids ouverts — mais lent, et dont l'avantage tarifaire est en partie absorbé par un raisonnement verbeux et non désactivable.
Aucun de ces évaluateurs ne contredit frontalement le tableau officiel de Qwen. Ils le complètent sur les deux dimensions que le constructeur n'a pas publiées : la vitesse et le coût réel.
Ce qui manque encore¶
À la date de rédaction, treize jours après l'annonce et un jour après la publication des poids, plusieurs évaluations importantes n'existent pas :
| Manquant | Conséquence |
|---|---|
| Évaluation de sécurité indépendante | aucune donnée sur les capacités à risque |
| Mesure du long contexte au-delà de 256 K | la revendication du million de jetons reste non testée |
| Évaluation des poids ouverts eux-mêmes | tous les scores tiers portent sur l'API |
| Reproduction du tableau officiel par un tiers | l'écart de 19 points sur Terminal-Bench reste ouvert |
Le quatrième point mérite attention : à ce jour, aucune évaluation indépendante ne porte sur le checkpoint téléchargeable. Les scores publiés par les tiers mesurent le service d'Alibaba, qui peut différer des poids par le harnais, le format d'invite, le réglage d'effort ou d'éventuels modules supplémentaires.
À retenir¶
Ce chapitre en cinq points
- Artificial Analysis place le modèle à l'indice 58, 10ᵉ sur 184.
- Il le mesure à 47 jetons/s, dans le dernier tiers en vitesse.
- Le coût par tâche — 1,13 $ — est plus révélateur que le tarif affiché.
- Le 2ᵉ rang en Vision Arena concerne l'API, pas les poids ouverts.
- Aucune évaluation indépendante ne porte encore sur le checkpoint téléchargeable.
Chapitre suivant : Les démonstrations agentiques.