Le tableau officiel¶
Les 31 lignes publiées par Qwen, reproduites intégralement, puis lues.
Le tableau¶
Source : carte de modèle Qwen/Qwen3.8-2.4T-A95B.
Toutes les valeurs sont celles publiées par Qwen. -- signifie « non mesuré ».
| Benchmark | Opus 4.8 | Fable 5 | GPT-5.6 Sol (max) | Qwen3.7-Max | Qwen3.8-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 84,6 | 84,6 | 88,8 | 74,5 | 86,6 |
| SWE-bench Pro | 69,2 | 80,0 | 64,6 | 60,6 | 67,7 |
| DeepSWE 1.1 | 59,0 | 70,0 | 73,0 | 21,6 | 56,6 |
| NL2Repo-Bench | 69,4 | -- | -- | 47,2 | 55,9 |
| FrontierSWE | 70,0 | 88,8 | -- | 40,7 | 73,5 |
| MLS-Bench-Lite | 42,8 | 49,9 | 46,2 | 31,7 | 41,0 |
| PaperBench | 80,3 | 88,8 | 90,5 | 64,8 | 93,0 |
| AndroidBench | 69,8 | 84,5 | 74,0 | 56,5 | 75,1 |
| QwenSWEBench | 84,0 | 86,3 | 73,5 | 63,4 | 80,7 |
| QwenQoderBench | 62,7 | 63,1 | 53,8 | 36,8 | 58,4 |
| QwenReactBench (Elo) | 1694 | 1770 | 1564 | 1538 | 1724 |
| QwenSVGBench (Elo) | 1648 | 1690 | 1758 | 1499 | 1713 |
| CoWorkBench | 72,3 | 75,9 | 71,5 | 64,6 | 74,8 |
| WorkSpaceBench | 66,8 | 68,7 | 65,6 | 61,4 | 67,7 |
| JobBench | 48,4 | 57,4 | 45,4 | 31,3 | 53,4 |
| SkillsBench | 65,1 | 70,9 | 73,5 | 61,2 | 70,2 |
| Agents' Last Exam (pass / score) | 27,0 / 45,1 | -- | 30,6 / 53,6 | 11,8 / 31,1 | 27,0 / 52,4 |
| Automation-Bench (pass@1) | 27,2 | 29,1 | 29,7 | 14,2 | 27,3 |
| Toolathlon Verified (pass@1) | 76,2 | 77,9 | 74,9 | 49,7 | 72,5 |
| WideSearch | 72,9 | 81,2 | -- | 75,2 | 81,9 |
| HLE avec outils | 57,9 | 64,5 | 58,0 | 53,5 | 56,2 |
| GPQA Diamond | 92,0 | 92,6 | 94,1 | 92,4 | 92,6 |
| HLE | 45,7 | 53,3 | 47,2 | 41,4 | 43,6 |
| IFBench | 62,2 | 63,5 | 72,7 | 79,1 | 82,8 |
| $OneMillion-Bench (score expert) | 41,8 | 55,9 | 53,8 | 44,4 | 52,5 |
| HealthBench | 52,4 | -- | 55,3 | 54,5 | 60,2 |
| PLawBench | 69,6 | 70,2 | 72,3 | 58,9 | 73,2 |
| PRBench-Legal | 52,7 | 57,6 | 57,6 | 48,5 | 57,6 |
| PRBench-Finance | 51,9 | 55,8 | 55,5 | 46,8 | 58,3 |
| MRCR v2 256K (8 aiguilles) | 83,2 | -- | 93,8 | 86,7 | 92,9 |
| LongBench v2 | 69,1 | -- | 67,1 | 65,3 | 66,3 |
En gras : le meilleur score de la ligne.
Le décompte¶
Sur les 31 lignes :
| Résultat | Nombre |
|---|---|
| Qwen3.8-Max premier | 7 |
| Qwen3.8-Max deuxième | 11 |
| Qwen3.8-Max troisième ou moins | 13 |
En excluant les huit benchmarks conçus par Qwen, sur les 23 lignes restantes : 6 premières places, dont PaperBench, WideSearch, IFBench, HealthBench, PLawBench et PRBench-Finance.
Où le modèle domine¶
| Benchmark | Qwen3.8-Max | Meilleur concurrent | Écart |
|---|---|---|---|
| PaperBench | 93,0 | 90,5 (GPT-5.6) | +2,5 |
| IFBench | 82,8 | 72,7 (GPT-5.6) | +10,1 |
| WideSearch | 81,9 | 81,2 (Fable 5) | +0,7 |
| HealthBench | 60,2 | 55,3 (GPT-5.6) | +4,9 |
| PLawBench | 73,2 | 72,3 (GPT-5.6) | +0,9 |
| PRBench-Finance | 58,3 | 55,8 (Fable 5) | +2,5 |
Le profil est cohérent : recherche, respect d'instructions, information à large couverture, domaines professionnels réglementés.
IFBench mérite l'attention
+10,1 points sur le respect d'instructions contraignantes, c'est le plus grand écart favorable du tableau, et de loin. Le prédécesseur Qwen3.7-Max était déjà premier sur cette ligne (79,1).
C'est une compétence peu spectaculaire mais décisive en usage réel : un modèle qui suit exactement le format demandé économise plus de temps qu'un modèle qui répond mieux mais qu'il faut reformater.
Où le modèle décroche¶
| Benchmark | Qwen3.8-Max | Meilleur | Écart |
|---|---|---|---|
| FrontierSWE | 73,5 | 88,8 (Fable 5) | −15,3 |
| SWE-bench Pro | 67,7 | 80,0 (Fable 5) | −12,3 |
| NL2Repo-Bench | 55,9 | 69,4 (Opus 4.8) | −13,5 |
| DeepSWE 1.1 | 56,6 | 73,0 (GPT-5.6) | −16,4 |
| HLE | 43,6 | 53,3 (Fable 5) | −9,7 |
| AndroidBench | 75,1 | 84,5 (Fable 5) | −9,4 |
Le point aveugle est le codage à l'échelle du dépôt
Les quatre benchmarks les plus proches du travail réel de développement — SWE-bench Pro, FrontierSWE, DeepSWE, NL2Repo — sont ceux où Qwen3.8-Max est le plus loin du meilleur, de 12 à 16 points.
Le titre du billet officiel est « A New Bar for Coding and Cowork ». Sur la partie « Coding » au sens le plus exigeant, le tableau du constructeur lui-même ne le soutient pas.
Sur les tâches de codage plus courtes et sur le front-end — QwenReactBench, Terminal-Bench — le modèle est en revanche compétitif.
Ce que le tableau a d'inhabituel¶
Il montre les défaites
Un tableau de lancement montre habituellement ce qui arrange. Celui-ci affiche Qwen3.8-Max perdant de 15,3 points sur FrontierSWE et de 16,4 sur DeepSWE, contre des concurrents nommés.
C'est rare et cela mérite d'être noté : la sélection des benchmarks reste favorable, mais les valeurs publiées ne sont pas maquillées. Cela crédibilise les lignes où le modèle gagne.
Le progrès sur la génération précédente¶
La colonne Qwen3.7-Max permet de mesurer le saut interne, et il est important.
| Benchmark | Qwen3.7-Max | Qwen3.8-Max | Gain |
|---|---|---|---|
| DeepSWE 1.1 | 21,6 | 56,6 | +35,0 |
| FrontierSWE | 40,7 | 73,5 | +32,8 |
| Agents' Last Exam (score) | 31,1 | 52,4 | +21,3 |
| Toolathlon Verified | 49,7 | 72,5 | +22,8 |
| JobBench | 31,3 | 53,4 | +22,1 |
| PaperBench | 64,8 | 93,0 | +28,2 |
| Terminal Bench 2.1 | 74,5 | 86,6 | +12,1 |
Le gain est concentré sur l'agentique
Les progrès les plus spectaculaires portent sur les tâches à long horizon et à outils. Sur le raisonnement pur — GPQA Diamond : 92,4 → 92,6 — il n'y a aucun progrès.
Cela suggère que l'essentiel de l'effort est allé au post-entraînement agentique plutôt qu'à la capacité brute. Aucune documentation ne le confirme.
Les lignes à ignorer¶
Pour toute comparaison entre modèles :
QwenSWEBench,QwenQoderBench,QwenReactBench,QwenSVGBench— conçus par Qwen ;CoWorkBench,WorkSpaceBench,JobBench,SkillsBench— la catégorie « Cowork », créée et définie par Qwen.
Ces huit lignes ne sont pas fausses ; elles ne permettent simplement pas de conclure sur les capacités relatives.
L'écart non expliqué¶
| Source | Terminal-Bench 2.1 |
|---|---|
| Ce tableau | 86,6 |
| Relevé indépendant rapporté par une veille sectorielle | 67,4 |
Dix-neuf points d'écart, non expliqués par les sources disponibles. Les causes possibles — version du harnais, effort de raisonnement, nombre de tentatives — ne sont documentées d'aucun côté.
Ce rapport ne tranche pas. Voir Affirmations à vérifier.
À retenir¶
Ce chapitre en cinq points
- Qwen3.8-Max est premier sur 7 des 31 lignes, dont 6 hors benchmarks maison.
- Il domine en recherche, respect d'instructions, santé, droit, finance — +10,1 points sur IFBench.
- Il décroche de 12 à 16 points sur le codage à l'échelle du dépôt, malgré le positionnement affiché.
- Le tableau est inhabituellement honnête sur ses défaites.
- Le gain sur Qwen3.7-Max est massif sur l'agentique (+35 sur DeepSWE) et nul sur le raisonnement pur (GPQA : +0,2).
Chapitre suivant : Évaluations indépendantes — les seuls chiffres qui ne viennent pas d'Alibaba.