Le tableau officiel¶
Les deux tableaux publiés par Qwen, reproduits intégralement, puis lus.
Tableau 1 — Texte¶
Source : carte de modèle Qwen/Qwen3.8-27B.
Toutes les valeurs sont celles publiées par Qwen. -- signifie « non mesuré ».
| Benchmark | Catégorie | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus 4.6 Max |
|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | Terminal agentique | 73,0 | 63,4 | 64,0 | 51,7 | 78,2 |
| SWE-bench Pro | Codage agentique | 61,7 | 53,5 | 57,6 | 51,2 | 53,4 |
| NL2Repo-Bench | Génération à l'échelle du dépôt | 42,3 | 36,2 | 41,1 | -- | 47,6 |
| DeepSWE 1.1 | Codage agentique | 42,2 | 13,3 | 14,2 | -- | -- |
| QwenSWEBench | Génie logiciel | 79,0 | 49,3 | 59,2 | -- | 63,8 |
| CoWorkBench | Travail de bureau à long horizon | 70,7 | 61,0 | 65,1 | -- | 68,2 |
| JobBench | Tâches professionnelles | 33,4 | 21,8 | 27,6 | -- | -- |
| Agents' Last Exam (Pass@1) | Agentique de frontière | 20,4 | 10,6 | 13,2 | -- | -- |
| Agents' Last Exam (Score) | Agentique de frontière | 42,9 | 27,3 | 33,6 | -- | -- |
| IFBench | Respect d'instructions | 79,5 | 69,1 | 79,1 | 77,0 | 62,5 |
| GPQA Diamond | Raisonnement scientifique | 89,2 | 87,8 | 90,3 | 83,5 | 91,3 |
| HLE | Raisonnement multidisciplinaire | 30,8 | 24,0 | 34,7 | 22,0 | 40,0 |
| LiveCodeBench v6 | Codage compétitif | 90,3 | 83,9 | 89,6 | -- | 88,8 |
En gras : le meilleur score de la ligne.
Tableau 2 — Vision-langage¶
| Benchmark | Catégorie | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus 4.6 Max |
|---|---|---|---|---|---|---|
| OSWorld-Verified | Usage d'ordinateur | 84,3 | 63,9 | 73,3 | 65,9 | 72,7 |
| WebArena-Verified | Usage du navigateur | 64,8 | 48,8 | 55,3 | -- | -- |
| AndroidWorld | Usage mobile | 81,9 | 70,3 | 81,0 | -- | 62,0 |
| RecreationBench | Recréation d'application | 47,1 | 29,8 | 30,2 | -- | -- |
| ClawEval-MM (Pass@3) | Outils multimodaux | 57,4 | 42,6 | 57,4 | -- | 52,5 |
| ClawEval-MM (moyenne) | Outils multimodaux | 56,9 | 50,4 | 60,1 | -- | 54,7 |
| SWE-MM | Génie logiciel multimodal | 38,6 | 25,7 | 30,0 | -- | 27,1 |
| Vision2Web | Développement web visuel | 62,9 | 45,0 | 42,1 | -- | -- |
| MathVision (sans interpréteur) | Mathématiques visuelles | 90,0 | 85,1 | -- | -- | 65,5 |
| MathVision (avec interpréteur) | Mathématiques visuelles | 94,6 | -- | 90,3 | -- | -- |
| BabyVision (sans interpréteur) | Raisonnement visuel général | 65,7 | 28,9 | 64,7 | -- | 12,6 |
| BabyVision (avec interpréteur) | Raisonnement visuel général | 85,6 | -- | 70,4 | -- | -- |
| CharXiv (sans interpréteur) | Analyse de graphiques | 83,7 | 78,4 | 85,8 | -- | 66,0 |
| CharXiv (avec interpréteur) | Analyse de graphiques | 90,2 | -- | 85,9 | -- | -- |
| OmniDocBench 1.5 | Intelligence documentaire | 91,1 | 89,4 | 91,4 | -- | 86,6 |
| RealWorldQA | Perception du monde réel | 85,9 | 84,1 | 86,9 | -- | 73,9 |
| ERQA | Intelligence incarnée | 65,5 | 62,5 | 69,8 | -- | 40,8 |
Le décompte¶
Sur les 30 lignes des deux tableaux :
| Résultat | Nombre |
|---|---|
| Qwen3.8-27B premier | 19 |
| Qwen3.8-27B deuxième | 8 |
| Qwen3.8-27B troisième ou moins | 3 |
En excluant les deux benchmarks portant le nom de Qwen ou créés par lui —
QwenSWEBench, CoWorkBench —, il reste 17 premières places sur 28.
Le saut sur le prédécesseur¶
C'est la comparaison la plus solide du tableau : deux modèles de la même maison, de la même taille, mesurés par la même équipe.
| Benchmark | Qwen3.6-27B | Qwen3.8-27B | Gain |
|---|---|---|---|
| BabyVision | 28,9 | 65,7 | +36,8 |
| QwenSWEBench | 49,3 | 79,0 | +29,7 |
| DeepSWE 1.1 | 13,3 | 42,2 | +28,9 |
| OSWorld-Verified | 63,9 | 84,3 | +20,4 |
| Vision2Web | 45,0 | 62,9 | +17,9 |
| RecreationBench | 29,8 | 47,1 | +17,3 |
| WebArena-Verified | 48,8 | 64,8 | +16,0 |
| Agents' Last Exam (Score) | 27,3 | 42,9 | +15,6 |
| SWE-MM | 25,7 | 38,6 | +12,9 |
| AndroidWorld | 70,3 | 81,9 | +11,6 |
| IFBench | 69,1 | 79,5 | +10,4 |
| Terminal Bench 2.1 | 63,4 | 73,0 | +9,6 |
| SWE-bench Pro | 53,5 | 61,7 | +8,2 |
| LiveCodeBench v6 | 83,9 | 90,3 | +6,4 |
| HLE | 24,0 | 30,8 | +6,8 |
| GPQA Diamond | 87,8 | 89,2 | +1,4 |
Le profil est sans ambiguïté
Les gains les plus larges portent sur le pilotage de machines (OSWorld +20,4, WebArena +16,0, AndroidWorld +11,6), le codage agentique (DeepSWE +28,9) et le raisonnement visuel (BabyVision +36,8).
Le plus faible porte sur le raisonnement scientifique pur : GPQA Diamond ne gagne que 1,4 point.
C'est exactement le profil observé sur Qwen3.8-Max, dont le GPQA n'avait progressé que de 0,2 point sur son prédécesseur.
La génération 3.8 est une génération d'agents, pas de raisonneurs.
Face à Opus 4.6 Max¶
Le modèle est comparé à un système propriétaire de tête. Sur les 19 lignes où les deux sont mesurés :
Qwen3.8-27B devant (15 lignes) :
| Benchmark | Qwen3.8-27B | Opus 4.6 Max | Écart |
|---|---|---|---|
| BabyVision | 65,7 | 12,6 | +53,1 |
| MathVision | 90,0 | 65,5 | +24,5 |
| ERQA | 65,5 | 40,8 | +24,7 |
| AndroidWorld | 81,9 | 62,0 | +19,9 |
| CharXiv | 83,7 | 66,0 | +17,7 |
| IFBench | 79,5 | 62,5 | +17,0 |
| RealWorldQA | 85,9 | 73,9 | +12,0 |
| OSWorld-Verified | 84,3 | 72,7 | +11,6 |
| SWE-MM | 38,6 | 27,1 | +11,5 |
| QwenSWEBench | 79,0 | 63,8 | +15,2 |
| SWE-bench Pro | 61,7 | 53,4 | +8,3 |
| ClawEval-MM (Pass@3) | 57,4 | 52,5 | +4,9 |
| OmniDocBench 1.5 | 91,1 | 86,6 | +4,5 |
| CoWorkBench | 70,7 | 68,2 | +2,5 |
| LiveCodeBench v6 | 90,3 | 88,8 | +1,5 |
Opus 4.6 Max devant (4 lignes) :
| Benchmark | Qwen3.8-27B | Opus 4.6 Max | Écart |
|---|---|---|---|
| HLE | 30,8 | 40,0 | −9,2 |
| Terminal Bench 2.1 | 73,0 | 78,2 | −5,2 |
| NL2Repo-Bench | 42,3 | 47,6 | −5,3 |
| GPQA Diamond | 89,2 | 91,3 | −2,1 |
Ce que ce contraste veut dire
Les quatre défaites sont exactement les benchmarks de connaissance et de raisonnement (HLE, GPQA) et de codage à l'échelle du dépôt (NL2Repo, Terminal-Bench).
Les quinze victoires sont des tâches visuelles ou agentiques.
Autrement dit : le post-entraînement et la voie visuelle peuvent hisser un petit modèle au-dessus d'un grand sur les tâches procédurales. La connaissance encyclopédique et le raisonnement de fond, eux, restent une fonction du nombre de paramètres.
Face à son propre grand frère¶
| Benchmark | Qwen3.8-27B | Qwen3.8-Max | Écart |
|---|---|---|---|
| SWE-bench Pro | 61,7 | 67,7 | −6,0 |
| OSWorld-Verified | 84,3 | 86,1 | −1,8 |
| CoWorkBench | 70,7 | 74,8 | −4,1 |
| JobBench | 33,4 | 53,4 | −20,0 |
| IFBench | 79,5 | 82,8 | −3,3 |
| Terminal Bench 2.1 | 73,0 | 86,6 | −13,6 |
| DeepSWE 1.1 | 42,2 | 56,6 | −14,4 |
| GPQA Diamond | 89,2 | 92,6 | −3,4 |
| HLE | 30,8 | 43,6 | −12,8 |
| Agents' Last Exam (Score) | 42,9 | 52,4 | −9,5 |
87 fois moins de paramètres, 2 à 6 points de moins
Sur OSWorld, IFBench, GPQA et CoWorkBench, l'écart est de 1,8 à 4,1 points — pour un modèle qui compte 27,7 G contre 2 446 G, soit un rapport de 88, et qui en active 3,4 fois moins par jeton.
L'écart se creuse en revanche à 12,8 points sur HLE et 20 points sur JobBench.
La lecture cohérente : les capacités procédurales saturent tôt et descendent bien vers les petits modèles ; les capacités de connaissance et de raisonnement long continuent d'échelonner avec la taille.
Prudence sur cette comparaison
Les deux tableaux n'ont pas les mêmes concurrents ni forcément les mêmes conditions d'exécution. Qwen ne publie ni le harnais ni le réglage d'effort de raisonnement pour l'un ou l'autre.
L'ordre de grandeur des écarts est parlant ; les valeurs exactes ne doivent pas être surinterprétées.
À retenir¶
Ce chapitre en cinq points
- 19 premières places sur 30 lignes, 17 sur 28 hors benchmarks maison.
- Le saut sur le prédécesseur est massif sur l'agentique et le visuel (jusqu'à +36,8) et quasi nul sur le raisonnement pur (GPQA : +1,4).
- Face à Opus 4.6 Max, le modèle gagne 15 fois sur 19 — mais perd précisément sur HLE et GPQA.
- Face à Qwen3.8-Max, 88 fois plus gros, il n'est qu'à 2 à 6 points sur l'agentique, mais 12,8 points derrière sur HLE.
- Toutes ces valeurs sont mesurées par Qwen ; aucune évaluation indépendante n'existe encore.
Chapitre suivant : Lecture critique.