Aller au contenu

Évaluations indépendantes

Les seuls chiffres qui ne viennent pas d'Alibaba — et le seul endroit où figure ce que coûte réellement une tâche.


Artificial Analysis

Artificial Analysis exécute un ensemble fixe d'évaluations sur tous les modèles, dans des conditions identiques, et publie sa méthodologie. C'est la référence la plus utile disponible.

L'indice d'intelligence

Mesure Valeur
Indice d'intelligence 58
Rang 10ᵉ sur 184 modèles

L'indice agrège neuf évaluations : GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR.

Positionnement rapporté : à hauteur de Claude Opus 4.8, devant tous les modèles de Google, Meta et xAI, derrière les offres de tête d'Anthropic et d'OpenAI — et derrière Kimi K3.

Une valeur qui a bougé

Les premiers relevés publiés donnaient 56, les suivants 58. Un changement de configuration d'évaluation ou une mise à jour côté service peut expliquer l'écart. C'est un rappel utile : même les indices indépendants ne sont pas des constantes.

La vitesse — le chiffre le plus important

Mesure Qwen3.8-Max Médiane de la catégorie
Vitesse de sortie 47,0 jetons/s 67,7 jetons/s
Rang en vitesse 119ᵉ sur 184 —
Délai au premier jeton 2,72 s —

Le modèle est lent, et cela compte plus que deux points de benchmark

47 jetons par seconde, contre une médiane de 67,7. Le modèle est dans le dernier tiers du classement de vitesse.

Sur une tâche agentique de 200 tours avec raisonnement xhigh — donc des dizaines de milliers de jetons invisibles par tour — cet écart de 30 % se traduit en heures d'attente.

Trois causes se cumulent :

  1. Le raisonnement forcé à xhigh produit énormément de jetons.
  2. La bande passante mémoire : 95 G de paramètres actifs à recharger par jeton (voir Quantification et matériel).
  3. La communication all-to-all du routage MoE, 92 fois par passe.

Le coût réel

Mesure Valeur
Prix affiché (entrée / sortie) 2,00 $ / 6,00 $
Prix mélangé (ratio 7:2:1 cache / entrée / sortie) 1,18 $ par million
Coût par tâche 1,13 $ — 58ᵉ sur 184

Le coût par tâche est la seule métrique honnête

Le prix affiché ne dit rien tant qu'on ne sait pas combien de jetons le modèle consomme pour accomplir quelque chose. Un modèle à 1 $ le million qui réfléchit dix fois plus longtemps coûte plus cher qu'un modèle à 5 $.

À 1,13 $ par tâche, Qwen3.8-Max se place au 58ᵉ rang sur 184 — bon, mais pas exceptionnel. Le raisonnement xhigh mange une bonne part de l'avantage tarifaire.


Vals AI

Mesure Valeur
Vals Index 66,1 %
Coût estimé par test 2,68 $
Latence d'évaluation ~2 760 s

Positionnement rapporté : 2ᵉ parmi les modèles à poids ouverts, 10ᵉ toutes catégories.

La latence de 2 760 secondes — 46 minutes pour une passe d'évaluation — confirme indépendamment le constat de lenteur.


LMArena

Classements par vote humain en comparaison aveugle.

Arène Rang Score
Text Arena 5ᵉ —
Vision Arena 2ᵉ 1 305
Frontend Code Arena 4ᵉ 1 668 Elo

Le rang en Vision Arena ne concerne pas les poids ouverts

LMArena teste ce qui est servi par l'API. L'API qwen3.8-max accepte les images ; le checkpoint Qwen3.8-2.4T-A95B non.

Toute mention de ce 2ᵉ rang comme propriété du modèle ouvert est une erreur. Voir Licence et disponibilité.

Au lancement, le modèle est devenu le modèle chinois le mieux classé en Text Arena.

Ce que mesure une arène de votes

Les préférences humaines en comparaison rapide favorisent les réponses longues, bien formatées, assertives. Elles corrèlent imparfaitement avec la justesse.

Un bon classement en arène indique un modèle agréable à utiliser. Ce n'est pas la même chose qu'un modèle fiable.


Synthèse

Source Nature Résultat
Artificial Analysis mesure standardisée indice 58, 10ᵉ/184
Artificial Analysis vitesse 47 j/s, 119ᵉ/184
Artificial Analysis coût par tâche 1,13 $, 58ᵉ/184
Vals AI mesure standardisée 66,1 %, 2ᵉ des ouverts
LMArena préférence humaine 5ᵉ texte, 4ᵉ front-end

Le tableau convergent :

Ce que disent les tiers

Qwen3.8-Max est un modèle de niveau frontière, dans le premier vingtième mondial en capacité, le meilleur ou presque parmi les modèles à poids ouverts — mais lent, et dont l'avantage tarifaire est en partie absorbé par un raisonnement verbeux et non désactivable.

Aucun de ces évaluateurs ne contredit frontalement le tableau officiel de Qwen. Ils le complètent sur les deux dimensions que le constructeur n'a pas publiées : la vitesse et le coût réel.


Ce qui manque encore

À la date de rédaction, treize jours après l'annonce et un jour après la publication des poids, plusieurs évaluations importantes n'existent pas :

Manquant Conséquence
Évaluation de sécurité indépendante aucune donnée sur les capacités à risque
Mesure du long contexte au-delà de 256 K la revendication du million de jetons reste non testée
Évaluation des poids ouverts eux-mêmes tous les scores tiers portent sur l'API
Reproduction du tableau officiel par un tiers l'écart de 19 points sur Terminal-Bench reste ouvert

Le quatrième point mérite attention : à ce jour, aucune évaluation indépendante ne porte sur le checkpoint téléchargeable. Les scores publiés par les tiers mesurent le service d'Alibaba, qui peut différer des poids par le harnais, le format d'invite, le réglage d'effort ou d'éventuels modules supplémentaires.


À retenir

Ce chapitre en cinq points

  1. Artificial Analysis place le modèle à l'indice 58, 10ᵉ sur 184.
  2. Il le mesure à 47 jetons/s, dans le dernier tiers en vitesse.
  3. Le coût par tâche — 1,13 $ — est plus révélateur que le tarif affiché.
  4. Le 2ᵉ rang en Vision Arena concerne l'API, pas les poids ouverts.
  5. Aucune évaluation indépendante ne porte encore sur le checkpoint téléchargeable.

Chapitre suivant : Les démonstrations agentiques.