Aller au contenu

Le tableau officiel

Les 31 lignes publiées par Qwen, reproduites intégralement, puis lues.


Le tableau

Source : carte de modèle Qwen/Qwen3.8-2.4T-A95B. Toutes les valeurs sont celles publiées par Qwen. -- signifie « non mesuré ».

Benchmark Opus 4.8 Fable 5 GPT-5.6 Sol (max) Qwen3.7-Max Qwen3.8-Max
Terminal Bench 2.1 84,6 84,6 88,8 74,5 86,6
SWE-bench Pro 69,2 80,0 64,6 60,6 67,7
DeepSWE 1.1 59,0 70,0 73,0 21,6 56,6
NL2Repo-Bench 69,4 -- -- 47,2 55,9
FrontierSWE 70,0 88,8 -- 40,7 73,5
MLS-Bench-Lite 42,8 49,9 46,2 31,7 41,0
PaperBench 80,3 88,8 90,5 64,8 93,0
AndroidBench 69,8 84,5 74,0 56,5 75,1
QwenSWEBench 84,0 86,3 73,5 63,4 80,7
QwenQoderBench 62,7 63,1 53,8 36,8 58,4
QwenReactBench (Elo) 1694 1770 1564 1538 1724
QwenSVGBench (Elo) 1648 1690 1758 1499 1713
CoWorkBench 72,3 75,9 71,5 64,6 74,8
WorkSpaceBench 66,8 68,7 65,6 61,4 67,7
JobBench 48,4 57,4 45,4 31,3 53,4
SkillsBench 65,1 70,9 73,5 61,2 70,2
Agents' Last Exam (pass / score) 27,0 / 45,1 -- 30,6 / 53,6 11,8 / 31,1 27,0 / 52,4
Automation-Bench (pass@1) 27,2 29,1 29,7 14,2 27,3
Toolathlon Verified (pass@1) 76,2 77,9 74,9 49,7 72,5
WideSearch 72,9 81,2 -- 75,2 81,9
HLE avec outils 57,9 64,5 58,0 53,5 56,2
GPQA Diamond 92,0 92,6 94,1 92,4 92,6
HLE 45,7 53,3 47,2 41,4 43,6
IFBench 62,2 63,5 72,7 79,1 82,8
$OneMillion-Bench (score expert) 41,8 55,9 53,8 44,4 52,5
HealthBench 52,4 -- 55,3 54,5 60,2
PLawBench 69,6 70,2 72,3 58,9 73,2
PRBench-Legal 52,7 57,6 57,6 48,5 57,6
PRBench-Finance 51,9 55,8 55,5 46,8 58,3
MRCR v2 256K (8 aiguilles) 83,2 -- 93,8 86,7 92,9
LongBench v2 69,1 -- 67,1 65,3 66,3

En gras : le meilleur score de la ligne.


Le décompte

Sur les 31 lignes :

Résultat Nombre
Qwen3.8-Max premier 7
Qwen3.8-Max deuxième 11
Qwen3.8-Max troisième ou moins 13

En excluant les huit benchmarks conçus par Qwen, sur les 23 lignes restantes : 6 premières places, dont PaperBench, WideSearch, IFBench, HealthBench, PLawBench et PRBench-Finance.


Où le modèle domine

Benchmark Qwen3.8-Max Meilleur concurrent Écart
PaperBench 93,0 90,5 (GPT-5.6) +2,5
IFBench 82,8 72,7 (GPT-5.6) +10,1
WideSearch 81,9 81,2 (Fable 5) +0,7
HealthBench 60,2 55,3 (GPT-5.6) +4,9
PLawBench 73,2 72,3 (GPT-5.6) +0,9
PRBench-Finance 58,3 55,8 (Fable 5) +2,5

Le profil est cohérent : recherche, respect d'instructions, information à large couverture, domaines professionnels réglementés.

IFBench mérite l'attention

+10,1 points sur le respect d'instructions contraignantes, c'est le plus grand écart favorable du tableau, et de loin. Le prédécesseur Qwen3.7-Max était déjà premier sur cette ligne (79,1).

C'est une compétence peu spectaculaire mais décisive en usage réel : un modèle qui suit exactement le format demandé économise plus de temps qu'un modèle qui répond mieux mais qu'il faut reformater.


Où le modèle décroche

Benchmark Qwen3.8-Max Meilleur Écart
FrontierSWE 73,5 88,8 (Fable 5) −15,3
SWE-bench Pro 67,7 80,0 (Fable 5) −12,3
NL2Repo-Bench 55,9 69,4 (Opus 4.8) −13,5
DeepSWE 1.1 56,6 73,0 (GPT-5.6) −16,4
HLE 43,6 53,3 (Fable 5) −9,7
AndroidBench 75,1 84,5 (Fable 5) −9,4

Le point aveugle est le codage à l'échelle du dépôt

Les quatre benchmarks les plus proches du travail réel de développement — SWE-bench Pro, FrontierSWE, DeepSWE, NL2Repo — sont ceux où Qwen3.8-Max est le plus loin du meilleur, de 12 à 16 points.

Le titre du billet officiel est « A New Bar for Coding and Cowork ». Sur la partie « Coding » au sens le plus exigeant, le tableau du constructeur lui-même ne le soutient pas.

Sur les tâches de codage plus courtes et sur le front-end — QwenReactBench, Terminal-Bench — le modèle est en revanche compétitif.


Ce que le tableau a d'inhabituel

Il montre les défaites

Un tableau de lancement montre habituellement ce qui arrange. Celui-ci affiche Qwen3.8-Max perdant de 15,3 points sur FrontierSWE et de 16,4 sur DeepSWE, contre des concurrents nommés.

C'est rare et cela mérite d'être noté : la sélection des benchmarks reste favorable, mais les valeurs publiées ne sont pas maquillées. Cela crédibilise les lignes où le modèle gagne.


Le progrès sur la génération précédente

La colonne Qwen3.7-Max permet de mesurer le saut interne, et il est important.

Benchmark Qwen3.7-Max Qwen3.8-Max Gain
DeepSWE 1.1 21,6 56,6 +35,0
FrontierSWE 40,7 73,5 +32,8
Agents' Last Exam (score) 31,1 52,4 +21,3
Toolathlon Verified 49,7 72,5 +22,8
JobBench 31,3 53,4 +22,1
PaperBench 64,8 93,0 +28,2
Terminal Bench 2.1 74,5 86,6 +12,1

Le gain est concentré sur l'agentique

Les progrès les plus spectaculaires portent sur les tâches à long horizon et à outils. Sur le raisonnement pur — GPQA Diamond : 92,4 → 92,6 — il n'y a aucun progrès.

Cela suggère que l'essentiel de l'effort est allé au post-entraînement agentique plutôt qu'à la capacité brute. Aucune documentation ne le confirme.


Les lignes à ignorer

Pour toute comparaison entre modèles :

  • QwenSWEBench, QwenQoderBench, QwenReactBench, QwenSVGBench — conçus par Qwen ;
  • CoWorkBench, WorkSpaceBench, JobBench, SkillsBench — la catégorie « Cowork », créée et définie par Qwen.

Ces huit lignes ne sont pas fausses ; elles ne permettent simplement pas de conclure sur les capacités relatives.


L'écart non expliqué

Source Terminal-Bench 2.1
Ce tableau 86,6
Relevé indépendant rapporté par une veille sectorielle 67,4

Dix-neuf points d'écart, non expliqués par les sources disponibles. Les causes possibles — version du harnais, effort de raisonnement, nombre de tentatives — ne sont documentées d'aucun côté.

Ce rapport ne tranche pas. Voir Affirmations à vérifier.


À retenir

Ce chapitre en cinq points

  1. Qwen3.8-Max est premier sur 7 des 31 lignes, dont 6 hors benchmarks maison.
  2. Il domine en recherche, respect d'instructions, santé, droit, finance — +10,1 points sur IFBench.
  3. Il décroche de 12 à 16 points sur le codage à l'échelle du dépôt, malgré le positionnement affiché.
  4. Le tableau est inhabituellement honnête sur ses défaites.
  5. Le gain sur Qwen3.7-Max est massif sur l'agentique (+35 sur DeepSWE) et nul sur le raisonnement pur (GPQA : +0,2).

Chapitre suivant : Évaluations indépendantes — les seuls chiffres qui ne viennent pas d'Alibaba.