Aller au contenu

Le tableau officiel

Les deux tableaux publiés par Qwen, reproduits intégralement, puis lus.


Tableau 1 — Texte

Source : carte de modèle Qwen/Qwen3.8-27B. Toutes les valeurs sont celles publiées par Qwen. -- signifie « non mesuré ».

Benchmark Catégorie Qwen3.8-27B Qwen3.6-27B Qwen3.7-Plus Muse Glimmer-30B Opus 4.6 Max
Terminal Bench 2.1 Terminal agentique 73,0 63,4 64,0 51,7 78,2
SWE-bench Pro Codage agentique 61,7 53,5 57,6 51,2 53,4
NL2Repo-Bench Génération à l'échelle du dépôt 42,3 36,2 41,1 -- 47,6
DeepSWE 1.1 Codage agentique 42,2 13,3 14,2 -- --
QwenSWEBench Génie logiciel 79,0 49,3 59,2 -- 63,8
CoWorkBench Travail de bureau à long horizon 70,7 61,0 65,1 -- 68,2
JobBench Tâches professionnelles 33,4 21,8 27,6 -- --
Agents' Last Exam (Pass@1) Agentique de frontière 20,4 10,6 13,2 -- --
Agents' Last Exam (Score) Agentique de frontière 42,9 27,3 33,6 -- --
IFBench Respect d'instructions 79,5 69,1 79,1 77,0 62,5
GPQA Diamond Raisonnement scientifique 89,2 87,8 90,3 83,5 91,3
HLE Raisonnement multidisciplinaire 30,8 24,0 34,7 22,0 40,0
LiveCodeBench v6 Codage compétitif 90,3 83,9 89,6 -- 88,8

En gras : le meilleur score de la ligne.


Tableau 2 — Vision-langage

Benchmark Catégorie Qwen3.8-27B Qwen3.6-27B Qwen3.7-Plus Muse Glimmer-30B Opus 4.6 Max
OSWorld-Verified Usage d'ordinateur 84,3 63,9 73,3 65,9 72,7
WebArena-Verified Usage du navigateur 64,8 48,8 55,3 -- --
AndroidWorld Usage mobile 81,9 70,3 81,0 -- 62,0
RecreationBench Recréation d'application 47,1 29,8 30,2 -- --
ClawEval-MM (Pass@3) Outils multimodaux 57,4 42,6 57,4 -- 52,5
ClawEval-MM (moyenne) Outils multimodaux 56,9 50,4 60,1 -- 54,7
SWE-MM Génie logiciel multimodal 38,6 25,7 30,0 -- 27,1
Vision2Web Développement web visuel 62,9 45,0 42,1 -- --
MathVision (sans interpréteur) Mathématiques visuelles 90,0 85,1 -- -- 65,5
MathVision (avec interpréteur) Mathématiques visuelles 94,6 -- 90,3 -- --
BabyVision (sans interpréteur) Raisonnement visuel général 65,7 28,9 64,7 -- 12,6
BabyVision (avec interpréteur) Raisonnement visuel général 85,6 -- 70,4 -- --
CharXiv (sans interpréteur) Analyse de graphiques 83,7 78,4 85,8 -- 66,0
CharXiv (avec interpréteur) Analyse de graphiques 90,2 -- 85,9 -- --
OmniDocBench 1.5 Intelligence documentaire 91,1 89,4 91,4 -- 86,6
RealWorldQA Perception du monde réel 85,9 84,1 86,9 -- 73,9
ERQA Intelligence incarnée 65,5 62,5 69,8 -- 40,8

Le décompte

Sur les 30 lignes des deux tableaux :

Résultat Nombre
Qwen3.8-27B premier 19
Qwen3.8-27B deuxième 8
Qwen3.8-27B troisième ou moins 3

En excluant les deux benchmarks portant le nom de Qwen ou créés par lui — QwenSWEBench, CoWorkBench —, il reste 17 premières places sur 28.


Le saut sur le prédécesseur

C'est la comparaison la plus solide du tableau : deux modèles de la même maison, de la même taille, mesurés par la même équipe.

Benchmark Qwen3.6-27B Qwen3.8-27B Gain
BabyVision 28,9 65,7 +36,8
QwenSWEBench 49,3 79,0 +29,7
DeepSWE 1.1 13,3 42,2 +28,9
OSWorld-Verified 63,9 84,3 +20,4
Vision2Web 45,0 62,9 +17,9
RecreationBench 29,8 47,1 +17,3
WebArena-Verified 48,8 64,8 +16,0
Agents' Last Exam (Score) 27,3 42,9 +15,6
SWE-MM 25,7 38,6 +12,9
AndroidWorld 70,3 81,9 +11,6
IFBench 69,1 79,5 +10,4
Terminal Bench 2.1 63,4 73,0 +9,6
SWE-bench Pro 53,5 61,7 +8,2
LiveCodeBench v6 83,9 90,3 +6,4
HLE 24,0 30,8 +6,8
GPQA Diamond 87,8 89,2 +1,4

Le profil est sans ambiguïté

Les gains les plus larges portent sur le pilotage de machines (OSWorld +20,4, WebArena +16,0, AndroidWorld +11,6), le codage agentique (DeepSWE +28,9) et le raisonnement visuel (BabyVision +36,8).

Le plus faible porte sur le raisonnement scientifique pur : GPQA Diamond ne gagne que 1,4 point.

C'est exactement le profil observé sur Qwen3.8-Max, dont le GPQA n'avait progressé que de 0,2 point sur son prédécesseur.

La génération 3.8 est une génération d'agents, pas de raisonneurs.


Face à Opus 4.6 Max

Le modèle est comparé à un système propriétaire de tête. Sur les 19 lignes où les deux sont mesurés :

Qwen3.8-27B devant (15 lignes) :

Benchmark Qwen3.8-27B Opus 4.6 Max Écart
BabyVision 65,7 12,6 +53,1
MathVision 90,0 65,5 +24,5
ERQA 65,5 40,8 +24,7
AndroidWorld 81,9 62,0 +19,9
CharXiv 83,7 66,0 +17,7
IFBench 79,5 62,5 +17,0
RealWorldQA 85,9 73,9 +12,0
OSWorld-Verified 84,3 72,7 +11,6
SWE-MM 38,6 27,1 +11,5
QwenSWEBench 79,0 63,8 +15,2
SWE-bench Pro 61,7 53,4 +8,3
ClawEval-MM (Pass@3) 57,4 52,5 +4,9
OmniDocBench 1.5 91,1 86,6 +4,5
CoWorkBench 70,7 68,2 +2,5
LiveCodeBench v6 90,3 88,8 +1,5

Opus 4.6 Max devant (4 lignes) :

Benchmark Qwen3.8-27B Opus 4.6 Max Écart
HLE 30,8 40,0 −9,2
Terminal Bench 2.1 73,0 78,2 −5,2
NL2Repo-Bench 42,3 47,6 −5,3
GPQA Diamond 89,2 91,3 −2,1

Ce que ce contraste veut dire

Les quatre défaites sont exactement les benchmarks de connaissance et de raisonnement (HLE, GPQA) et de codage à l'échelle du dépôt (NL2Repo, Terminal-Bench).

Les quinze victoires sont des tâches visuelles ou agentiques.

Autrement dit : le post-entraînement et la voie visuelle peuvent hisser un petit modèle au-dessus d'un grand sur les tâches procédurales. La connaissance encyclopédique et le raisonnement de fond, eux, restent une fonction du nombre de paramètres.


Face à son propre grand frère

Benchmark Qwen3.8-27B Qwen3.8-Max Écart
SWE-bench Pro 61,7 67,7 −6,0
OSWorld-Verified 84,3 86,1 −1,8
CoWorkBench 70,7 74,8 −4,1
JobBench 33,4 53,4 −20,0
IFBench 79,5 82,8 −3,3
Terminal Bench 2.1 73,0 86,6 −13,6
DeepSWE 1.1 42,2 56,6 −14,4
GPQA Diamond 89,2 92,6 −3,4
HLE 30,8 43,6 −12,8
Agents' Last Exam (Score) 42,9 52,4 −9,5

87 fois moins de paramètres, 2 à 6 points de moins

Sur OSWorld, IFBench, GPQA et CoWorkBench, l'écart est de 1,8 à 4,1 points — pour un modèle qui compte 27,7 G contre 2 446 G, soit un rapport de 88, et qui en active 3,4 fois moins par jeton.

L'écart se creuse en revanche à 12,8 points sur HLE et 20 points sur JobBench.

La lecture cohérente : les capacités procédurales saturent tôt et descendent bien vers les petits modèles ; les capacités de connaissance et de raisonnement long continuent d'échelonner avec la taille.

Prudence sur cette comparaison

Les deux tableaux n'ont pas les mêmes concurrents ni forcément les mêmes conditions d'exécution. Qwen ne publie ni le harnais ni le réglage d'effort de raisonnement pour l'un ou l'autre.

L'ordre de grandeur des écarts est parlant ; les valeurs exactes ne doivent pas être surinterprétées.


À retenir

Ce chapitre en cinq points

  1. 19 premières places sur 30 lignes, 17 sur 28 hors benchmarks maison.
  2. Le saut sur le prédécesseur est massif sur l'agentique et le visuel (jusqu'à +36,8) et quasi nul sur le raisonnement pur (GPQA : +1,4).
  3. Face à Opus 4.6 Max, le modèle gagne 15 fois sur 19 — mais perd précisément sur HLE et GPQA.
  4. Face à Qwen3.8-Max, 88 fois plus gros, il n'est qu'à 2 à 6 points sur l'agentique, mais 12,8 points derrière sur HLE.
  5. Toutes ces valeurs sont mesurées par Qwen ; aucune évaluation indépendante n'existe encore.

Chapitre suivant : Lecture critique.