Aller au contenu

Le verdict des hypothèses

Douze prédictions faites la veille de la sortie, notées une par une.


La règle du jeu

Le 13 août 2026, ce rapport listait douze hypothèses sur l'architecture de Qwen3.8-27B, chacune avec un degré de confiance déclaré :

Niveau Signification
probable les deux ancres concordaient, ou une raison technique forte l'imposait
possible les ancres divergeaient, aucune ne l'emportait clairement
incertain aucune ancre ne tranchait
improbable une raison technique forte s'y opposait

Le modèle est sorti le 14. Voici le résultat.


Le tableau

# Prédiction Confiance annoncée Réalité Verdict
1 Contexte natif 262 144 probable 262 144 ✅
2 Extension ~1 010 000 probable 1 000 000 ⚠️ à 1 %
3 Vocabulaire 248 320 probable 248 320 ✅
4 Architecture dense possible dense ✅
5 Attention hybride 3:1 possible hybride 3:1 ✅
6 GQA agressif possible 6:1, pas 16:1 ⚠️ partiel
7 RoPE partiel, base \(10^7\) possible oui, plus mRoPE ✅
8 Prédiction multi-jetons possible 1 couche ✅
9 Raisonnement forcé possible (risque) désactivable ❌
10 MoE à 512 experts improbable dense ✅
11 Multimodal dans les poids incertain oui ✅
12 Licence Apache 2.0 incertain oui ✅

Neuf exactes, deux approximatives, une fausse.


Les deux réussites qui comptaient

#5 — L'attention hybride 3:1

C'était l'enjeu déclaré : « la question qui décide de tout, pour un usage local », avec un facteur 4 sur le cache à la clé.

Le rapport présentait trois scénarios. Le scénario B — dense, hybride 3:1 — est celui qui s'est réalisé, et ses chiffres se vérifient exactement :

Grandeur Prédit (scénario B) Réel Écart
Cache par jeton 64 KiO 64 KiO 0 %
Cache à 262 144 jetons 17,18 Go 17,18 Go 0 %
Cache à 1 M 66,19 Go 65,54 Go 1 %

Une exactitude en partie chanceuse, et il faut le dire

Les hypothèses de forme du script étaient fausses sur deux des quatre valeurs :

Paramètre Supposé Réel
Couches 64 64 ✅
Dimension cachée 5 120 5 120 ✅
Têtes clé-valeur 8 4 ❌
Dimension de tête 128 256 ❌

Or le cache ne dépend que du produit \(H_{kv} \times d_h\) :

\[ 8 \times 128 = 1\,024 = 4 \times 256 \]

Les deux erreurs se sont exactement compensées. Le résultat est juste pour de mauvaises raisons.

C'est un rappel utile : un chiffre correct ne valide pas les hypothèses qui l'ont produit. La bonne méthode aurait été de raisonner directement sur la dimension de cache totale — qui est ce que l'équipe Qwen fixe, comme le montre le fait que le Max ait exactement la même.

#12 — La licence Apache 2.0

Le rapport la classait « incertain », et lui consacrait un chapitre entier de mise en garde : le seul précédent de la génération 3.8 — le Max — était sorti sous licence maison.

Le verdict est favorable, mais la prudence était justifiée.

Une prudence qui n'a rien coûté

La recommandation était : « pour un projet qui démarre maintenant, utilisez Qwen3.6-27B, publié et sous Apache 2.0 ; migrez ensuite si la licence le permet. »

Elle reste la bonne décision a posteriori : le coût de la prudence était nul — le prédécesseur est excellent — et le risque évité était réel.

Voir Le risque de licence.


Les deux approximations

#2 — L'extension du contexte

Prédit 1 010 000, réel 1 000 000. Écart de 1 %.

Le raisonnement était : Qwen3.6-27B et Qwen3.8-Max affichent tous deux exactement 1 010 000, donc la génération a une constante.

L'erreur était de chercher une valeur technique là où il y a un arrondi

1 010 000 n'est pas plus « technique » que 1 000 000 — ni l'un ni l'autre n'est une puissance de deux. Ce sont deux arrondis de communication.

Sans conséquence pratique, mais le raisonnement était plus fragile qu'il n'y paraissait.

#6 — Le GQA

Prédit « agressif », par analogie avec le 16:1 du Max. Réel : 6:1 — 24 têtes de requête pour 4 clé-valeur.

Faux sur le ratio, juste sur ce qui compte

Le ratio GQA n'est pas ce qui détermine le cache : c'est \(H_{kv} \times d_h\). Le 27B a exactement le même nombre de têtes clé-valeur et la même dimension de tête que le Max.

Son cache par couche est donc identique à celui du Max, malgré un ratio trois fois moins « agressif ».

L'erreur porte sur l'indicateur regardé, pas sur la grandeur qui compte.


L'erreur

#9 — Le raisonnement forcé

Le rapport écrivait :

« Si le 27B hérite de cette contrainte, son utilisabilité interactive en souffrira sérieusement. »

Il n'en a pas hérité. enable_thinking: False fonctionne, reasoning_effort est réglable sur trois niveaux, et un paramètre preserve_thinking complète le dispositif.

Une crainte, pas une prédiction — mais elle méritait d'être signalée

Ce point était classé « possible » et présenté comme un risque à vérifier le jour J, pas comme une caractéristique attendue.

Le signaler était utile : c'était l'un des cinq points de la liste de vérification, et l'enjeu était réel — sur une carte grand public produisant 30 jetons par seconde, un raisonnement forcé de trente mille jetons coûte seize minutes avant le premier mot.

Mais l'inférence sous-jacente — « le Max le fait, donc le 27B le fera » — était mauvaise. Les deux modèles ne s'adressent pas au même usage, et Alibaba l'a manifestement compris.


Les trois scénarios, revisités

Le rapport présentait trois scénarios d'architecture avec une probabilité argumentée :

Scénario Probabilité annoncée Réalité
A · dense, attention complète possible ❌
B · dense, hybride 3:1 possible ✅ c'est celui-ci
C · MoE creux improbable ❌

Le classement était correct

C, jugé improbable, ne s'est pas réalisé — et pour exactement la raison avancée : un MoE de 27 G actifs ne tiendrait pas sur une carte.

A et B étaient donnés à égalité. B a gagné. Le rapport ne tranchait pas, ce qui était la position honnête compte tenu de l'information disponible.

Ce que le rapport n'avait pas envisagé du tout

Deux éléments n'apparaissaient dans aucun des trois scénarios :

  • le mRoPE et sa section [11, 11, 10] — le rapport n'avait pas anticipé que la multimodalité imposerait une variante du RoPE ;
  • la taille de l'encodeur visuel — 461 M, soit 1,7 % du modèle — qui n'était pas budgétée dans le décompte des 27 milliards.

Les scénarios étaient tous construits autour de l'attention et du cache. C'était le bon axe pour le dimensionnement matériel, mais une vue incomplète de l'architecture.


Ce que cet exercice enseigne

Trois leçons de méthode

1. Les contraintes physiques prédisent mieux que les analogies. Le scénario MoE a été correctement écarté par un argument de mémoire, pas par une comparaison avec des modèles voisins. Inversement, la prédiction ratée sur le raisonnement forcé reposait sur une pure analogie avec le Max.

2. Raisonner sur la grandeur qui compte, pas sur son indicateur. Le ratio GQA était faux, le produit \(H_{kv} \times d_h\) était juste. C'est le second qui détermine le cache.

3. Un bon résultat ne valide pas la méthode qui l'a produit. Le cache prédit à 64 KiO près était exact grâce à deux erreurs qui se compensaient. Sans la vérification post-publication, cette fragilité serait passée pour de la précision.


À retenir

Ce chapitre en cinq points

  1. Sur douze prédictions : neuf exactes, deux approximatives, une fausse.
  2. Le scénario retenu — dense, hybride 3:1 — était l'un des deux jugés possibles ; ses chiffres de cache se vérifient exactement.
  3. Cette exactitude tient à deux erreurs qui se compensent : 8 × 128 = 4 × 256.
  4. La seule prédiction fausse — le raisonnement forcé — était une crainte signalée, fondée sur une analogie faible.
  5. Le mRoPE et la taille de l'encodeur visuel n'avaient été envisagés dans aucun scénario.

Partie suivante : Matériel.