Le verdict des hypothèses¶
Douze prédictions faites la veille de la sortie, notées une par une.
La règle du jeu¶
Le 13 août 2026, ce rapport listait douze hypothèses sur l'architecture de Qwen3.8-27B, chacune avec un degré de confiance déclaré :
| Niveau | Signification |
|---|---|
| probable | les deux ancres concordaient, ou une raison technique forte l'imposait |
| possible | les ancres divergeaient, aucune ne l'emportait clairement |
| incertain | aucune ancre ne tranchait |
| improbable | une raison technique forte s'y opposait |
Le modèle est sorti le 14. Voici le résultat.
Le tableau¶
| # | Prédiction | Confiance annoncée | Réalité | Verdict |
|---|---|---|---|---|
| 1 | Contexte natif 262 144 | probable | 262 144 | ✅ |
| 2 | Extension ~1 010 000 | probable | 1 000 000 | ⚠️ à 1 % |
| 3 | Vocabulaire 248 320 | probable | 248 320 | ✅ |
| 4 | Architecture dense | possible | dense | ✅ |
| 5 | Attention hybride 3:1 | possible | hybride 3:1 | ✅ |
| 6 | GQA agressif | possible | 6:1, pas 16:1 | ⚠️ partiel |
| 7 | RoPE partiel, base \(10^7\) | possible | oui, plus mRoPE | ✅ |
| 8 | Prédiction multi-jetons | possible | 1 couche | ✅ |
| 9 | Raisonnement forcé | possible (risque) | désactivable | ❌ |
| 10 | MoE à 512 experts | improbable | dense | ✅ |
| 11 | Multimodal dans les poids | incertain | oui | ✅ |
| 12 | Licence Apache 2.0 | incertain | oui | ✅ |
Neuf exactes, deux approximatives, une fausse.
Les deux réussites qui comptaient¶
#5 — L'attention hybride 3:1¶
C'était l'enjeu déclaré : « la question qui décide de tout, pour un usage local », avec un facteur 4 sur le cache à la clé.
Le rapport présentait trois scénarios. Le scénario B — dense, hybride 3:1 — est celui qui s'est réalisé, et ses chiffres se vérifient exactement :
| Grandeur | Prédit (scénario B) | Réel | Écart |
|---|---|---|---|
| Cache par jeton | 64 KiO | 64 KiO | 0 % |
| Cache à 262 144 jetons | 17,18 Go | 17,18 Go | 0 % |
| Cache à 1 M | 66,19 Go | 65,54 Go | 1 % |
Une exactitude en partie chanceuse, et il faut le dire
Les hypothèses de forme du script étaient fausses sur deux des quatre valeurs :
| Paramètre | Supposé | Réel |
|---|---|---|
| Couches | 64 | 64 ✅ |
| Dimension cachée | 5 120 | 5 120 ✅ |
| Têtes clé-valeur | 8 | 4 ❌ |
| Dimension de tête | 128 | 256 ❌ |
Or le cache ne dépend que du produit \(H_{kv} \times d_h\) :
Les deux erreurs se sont exactement compensées. Le résultat est juste pour de mauvaises raisons.
C'est un rappel utile : un chiffre correct ne valide pas les hypothèses qui l'ont produit. La bonne méthode aurait été de raisonner directement sur la dimension de cache totale — qui est ce que l'équipe Qwen fixe, comme le montre le fait que le Max ait exactement la même.
#12 — La licence Apache 2.0¶
Le rapport la classait « incertain », et lui consacrait un chapitre entier de mise en garde : le seul précédent de la génération 3.8 — le Max — était sorti sous licence maison.
Le verdict est favorable, mais la prudence était justifiée.
Une prudence qui n'a rien coûté
La recommandation était : « pour un projet qui démarre maintenant, utilisez Qwen3.6-27B, publié et sous Apache 2.0 ; migrez ensuite si la licence le permet. »
Elle reste la bonne décision a posteriori : le coût de la prudence était nul — le prédécesseur est excellent — et le risque évité était réel.
Voir Le risque de licence.
Les deux approximations¶
#2 — L'extension du contexte¶
Prédit 1 010 000, réel 1 000 000. Écart de 1 %.
Le raisonnement était : Qwen3.6-27B et Qwen3.8-Max affichent tous deux exactement 1 010 000, donc la génération a une constante.
L'erreur était de chercher une valeur technique là où il y a un arrondi
1 010 000 n'est pas plus « technique » que 1 000 000 — ni l'un ni l'autre n'est une puissance de deux. Ce sont deux arrondis de communication.
Sans conséquence pratique, mais le raisonnement était plus fragile qu'il n'y paraissait.
#6 — Le GQA¶
Prédit « agressif », par analogie avec le 16:1 du Max. Réel : 6:1 — 24 têtes de requête pour 4 clé-valeur.
Faux sur le ratio, juste sur ce qui compte
Le ratio GQA n'est pas ce qui détermine le cache : c'est \(H_{kv} \times d_h\). Le 27B a exactement le même nombre de têtes clé-valeur et la même dimension de tête que le Max.
Son cache par couche est donc identique à celui du Max, malgré un ratio trois fois moins « agressif ».
L'erreur porte sur l'indicateur regardé, pas sur la grandeur qui compte.
L'erreur¶
#9 — Le raisonnement forcé¶
Le rapport écrivait :
« Si le 27B hérite de cette contrainte, son utilisabilité interactive en souffrira sérieusement. »
Il n'en a pas hérité. enable_thinking: False fonctionne, reasoning_effort est
réglable sur trois niveaux, et un paramètre preserve_thinking complète le
dispositif.
Une crainte, pas une prédiction — mais elle méritait d'être signalée
Ce point était classé « possible » et présenté comme un risque à vérifier le jour J, pas comme une caractéristique attendue.
Le signaler était utile : c'était l'un des cinq points de la liste de vérification, et l'enjeu était réel — sur une carte grand public produisant 30 jetons par seconde, un raisonnement forcé de trente mille jetons coûte seize minutes avant le premier mot.
Mais l'inférence sous-jacente — « le Max le fait, donc le 27B le fera » — était mauvaise. Les deux modèles ne s'adressent pas au même usage, et Alibaba l'a manifestement compris.
Les trois scénarios, revisités¶
Le rapport présentait trois scénarios d'architecture avec une probabilité argumentée :
| Scénario | Probabilité annoncée | Réalité |
|---|---|---|
| A · dense, attention complète | possible | ❌ |
| B · dense, hybride 3:1 | possible | ✅ c'est celui-ci |
| C · MoE creux | improbable | ❌ |
Le classement était correct
C, jugé improbable, ne s'est pas réalisé — et pour exactement la raison avancée : un MoE de 27 G actifs ne tiendrait pas sur une carte.
A et B étaient donnés à égalité. B a gagné. Le rapport ne tranchait pas, ce qui était la position honnête compte tenu de l'information disponible.
Ce que le rapport n'avait pas envisagé du tout
Deux éléments n'apparaissaient dans aucun des trois scénarios :
- le mRoPE et sa section
[11, 11, 10]— le rapport n'avait pas anticipé que la multimodalité imposerait une variante du RoPE ; - la taille de l'encodeur visuel — 461 M, soit 1,7 % du modèle — qui n'était pas budgétée dans le décompte des 27 milliards.
Les scénarios étaient tous construits autour de l'attention et du cache. C'était le bon axe pour le dimensionnement matériel, mais une vue incomplète de l'architecture.
Ce que cet exercice enseigne¶
Trois leçons de méthode
1. Les contraintes physiques prédisent mieux que les analogies. Le scénario MoE a été correctement écarté par un argument de mémoire, pas par une comparaison avec des modèles voisins. Inversement, la prédiction ratée sur le raisonnement forcé reposait sur une pure analogie avec le Max.
2. Raisonner sur la grandeur qui compte, pas sur son indicateur. Le ratio GQA était faux, le produit \(H_{kv} \times d_h\) était juste. C'est le second qui détermine le cache.
3. Un bon résultat ne valide pas la méthode qui l'a produit. Le cache prédit à 64 KiO près était exact grâce à deux erreurs qui se compensaient. Sans la vérification post-publication, cette fragilité serait passée pour de la précision.
À retenir¶
Ce chapitre en cinq points
- Sur douze prédictions : neuf exactes, deux approximatives, une fausse.
- Le scénario retenu — dense, hybride 3:1 — était l'un des deux jugés possibles ; ses chiffres de cache se vérifient exactement.
- Cette exactitude tient à deux erreurs qui se compensent : 8 × 128 = 4 × 256.
- La seule prédiction fausse — le raisonnement forcé — était une crainte signalée, fondée sur une analogie faible.
- Le mRoPE et la taille de l'encodeur visuel n'avaient été envisagés dans aucun scénario.
Partie suivante : Matériel.