Aller au contenu

Évaluations

Trente et un benchmarks publiés par Qwen, quatre évaluations indépendantes, et cinq démonstrations spectaculaires. Comment les lire.


Le principe de cette partie

Une règle, appliquée sans exception :

Un benchmark publié par le constructeur n'est pas une évaluation

Il n'est pas non plus un mensonge. C'est une mesure faite par une partie intéressée, dans des conditions qu'elle choisit, avec un harnais qu'elle contrôle, et publiée si elle est favorable.

Ces mesures ont une valeur : elles indiquent ce que l'équipe a optimisé et ce qu'elle juge défendable. Elles n'établissent pas de comparaison contrôlée.

Cette partie sépare donc strictement :

Chapitre Nature
02 · Le tableau officiel mesures de Qwen
03 · Évaluations indépendantes tiers
04 · Les démonstrations agentiques démonstrations de Qwen

Les quatre chapitres

01 · Comprendre les benchmarks

Ce que mesure chacun des benchmarks cités, et les quatre pièges qui rendent deux scores incomparables. À lire avant le tableau.

~20 min · ★★☆

02 · Le tableau officiel

Les 31 lignes reproduites intégralement, avec les concurrents, et l'analyse de ce qu'elles montrent — y compris les défaites.

~20 min · ★★☆

03 · Évaluations indépendantes

Artificial Analysis, Vals AI, LMArena. Les seuls chiffres qui ne viennent pas d'Alibaba — et le seul endroit où la vitesse est mesurée.

~15 min · ★★☆

04 · Les démonstrations agentiques

Seize jours de codage autonome, une puce optimisée, une boutique gérée un an. Ce que ces démonstrations montrent, et ce qu'elles ne montrent pas.

~15 min · ★★☆


Le résultat en une phrase, pour les pressés

Qwen3.8-Max est excellent en recherche, en rédaction longue et en usage bureautique, au niveau du meilleur en raisonnement scientifique, et nettement en retrait sur le codage à l'échelle du dépôt — précisément le domaine que le titre du billet officiel met en avant.

Il est par ailleurs lent : 47 jetons par seconde, contre une médiane de 67,7 pour les modèles de raisonnement comparables.


Un avertissement particulier à ce modèle

Un même benchmark reçoit des scores contradictoires selon la source.

Source Terminal-Bench 2.1
Tableau officiel Qwen 86,6
Relevé rapporté par une veille indépendante 67,4

Un écart de 19 points sur le même benchmark et le même modèle. Les explications possibles — version du harnais, nombre de tentatives, configuration de l'effort de raisonnement — ne sont documentées d'aucun côté.

Ce rapport signale l'écart plutôt que de choisir. Voir Affirmations à vérifier.


Commencer : Comprendre les benchmarks.