Aller au contenu

Lecture critique

Comment lire ces trente lignes — et ce qu'elles ne mesurent pas du tout.


Ce que le tableau a pour lui

Commençons par le crédit, parce qu'il est mérité.

Trois choix méthodologiquement corrects

1. Le prédécesseur est en première colonne de comparaison. Qwen3.6-27B a la même taille, vient de la même maison, et c'est la seule comparaison qui décide réellement d'une migration. Beaucoup de constructeurs l'omettent justement parce qu'elle est exigeante.

2. Les défaites sont publiées. Terminal-Bench, NL2Repo, GPQA et HLE montrent le modèle derrière Opus 4.6 Max, avec des écarts allant jusqu'à 9,2 points. Un tableau entièrement vert serait moins crédible.

3. Les deux modalités sont séparées. Texte et vision-langage ont chacun leur tableau, avec les benchmarks appropriés. C'est plus honnête qu'un agrégat unique.


Les quatre réserves

1. Deux benchmarks sur trente sont maison

QwenSWEBench et CoWorkBench sont conçus par Qwen.

Et ils affichent justement de larges écarts favorables

Benchmark Qwen3.8-27B Qwen3.6-27B Écart
QwenSWEBench 79,0 49,3 +29,7
CoWorkBench 70,7 61,0 +9,7

Le premier est le deuxième plus large gain du tableau texte. Créer un benchmark, c'est décider de ce qui compte : un modèle qui gagne sur le benchmark de son créateur n'a établi qu'une chose, que l'équipe a optimisé ce qu'elle mesure.

Ces deux lignes doivent être lues comme du positionnement, pas comme de la mesure comparative.

C'est nettement moins qu'avec le Max, dont huit lignes sur trente et une étaient des créations maison. Sur ce point, le tableau du 27B est plus propre.

2. Le harnais n'est jamais précisé

Un modèle qui résout des issues GitHub ou pilote un système d'exploitation opère dans un harnais : la boucle qui lui donne des outils, gère les erreurs et décide du nombre de tentatives.

Un même modèle peut varier de vingt points selon le harnais

Le tableau ne précise pas quel harnais a servi pour chaque colonne. Comparer un score obtenu avec un harnais maison à un score obtenu avec un autre n'est pas comparer deux modèles.

C'est la source d'incomparabilité la plus fréquente, et elle est ici totale : aucune information n'est donnée.

3. L'effort de raisonnement n'est pas documenté

Le modèle expose trois niveaux — low, medium, xhigh — et un même modèle à xhigh peut dépasser de dix points sa propre version à medium, en consommant dix fois plus de jetons et de temps.

Le tableau ne dit ni à quel effort Qwen3.8-27B a été mesuré, ni comment les concurrents ont été réglés.

Une conséquence pratique directe

Si les scores publiés sont obtenus à xhigh, l'expérience que vous aurez en local à medium sera sensiblement inférieure — et vos temps de génération seront ceux de xhigh si vous voulez les égaler.

Voir Servir le modèle.

4. « Avec interpréteur » n'est pas comparable à « sans »

Quatre lignes du tableau vision existent en deux versions :

Benchmark Sans interpréteur Avec interpréteur Apport
MathVision 90,0 94,6 +4,6
BabyVision 65,7 85,6 +19,9
CharXiv 83,7 90,2 +6,5

L'apport de l'outil est parfois plus grand que l'écart entre modèles

+19,9 points sur BabyVision grâce au seul interpréteur de code. C'est davantage que l'écart entre Qwen3.8-27B et la plupart de ses concurrents sur la même ligne.

Quand le tableau compare un « avec interpréteur » de Qwen à un « sans » d'un concurrent — c'est le cas de CharXiv face à Qwen3.7-Plus, 90,2 contre 85,9 — la comparaison n'a pas de sens.

À votre décharge : le tableau étiquette clairement les deux régimes, ce qui permet de faire le tri. C'est un point en sa faveur.


Ce qui n'est pas mesuré du tout

Dimension Statut
Long contexte aucun benchmark, alors que le modèle revendique 1 M de jetons
Vitesse de génération non mesurée
Coût par tâche sans objet en local, mais aucune donnée de débit
Fiabilité sur la durée non mesurée
Sécurité, capacités à risque aucune évaluation
Multilinguisme aucun benchmark dédié
Qualité après quantification non mesurée

L'absence la plus criante : le long contexte

Le modèle annonce 262 144 jetons natifs et 1 000 000 étendus. Aucune des trente lignes n'évalue le long contexte — ni RULER, ni MRCR, ni LongBench.

Le Max avait au moins une ligne MRCR v2 à 256 K. Ici, rien.

C'est d'autant plus regrettable que l'architecture hybride est précisément conçue pour le contexte long, et que l'attention linéaire est connue pour dégrader le rappel exact. La question la plus intéressante sur ce modèle est celle qui n'est pas mesurée.

Et pour un modèle local, la quantification

La quasi-totalité des utilisateurs feront tourner ce modèle en 4 bits ou en FP8, pas en BF16. Aucune mesure ne documente la dégradation associée.

Voir Quantification.


Aucune évaluation indépendante

À la date de rédaction — un jour après la publication — ni Artificial Analysis, ni Vals AI, ni LMArena n'ont publié de mesure sur Qwen3.8-27B.

C'est normal, et cela va changer vite

Le prédécesseur Qwen3.6-27B a été largement évalué par des tiers. Un modèle sous Apache 2.0, de 27 G, multimodal, qui tient sur une carte, sera mesuré dans les jours qui suivent par un grand nombre d'équipes.

C'est ce qu'il faut attendre avant toute décision engageante.


Comment lire ce tableau, en pratique

Trois règles :

  1. Donnez le plus de poids à la colonne Qwen3.6-27B. Même taille, même maison, même équipe de mesure — c'est la comparaison la moins biaisée du tableau, et elle est excellente pour le modèle.
  2. Ignorez QwenSWEBench et CoWorkBench pour toute comparaison entre constructeurs.
  3. Ne comparez pas les régimes « avec » et « sans » interpréteur, et ne comparez que les écarts larges — au-delà de 3 à 5 points selon la taille du benchmark.

À retenir

Ce chapitre en cinq points

  1. Le tableau est méthodologiquement plus propre que celui du Max : deux benchmarks maison sur trente, contre huit sur trente et une.
  2. Il publie ses défaites, ce qui crédibilise ses victoires.
  3. Ni le harnais ni l'effort de raisonnement ne sont documentés.
  4. Les régimes « avec interpréteur » valent jusqu'à +19,9 points et ne se comparent pas aux régimes « sans ».
  5. Le long contexte n'est mesuré nulle part, alors que c'est la raison d'être de l'architecture — et aucune évaluation indépendante n'existe encore.

Partie suivante : Les déductions, confrontées aux faits.