Vue d'ensemble¶
Le modèle entier en un schéma, un motif et un tableau.
Le motif¶
Qwen3.8-Max empile 23 fois le bloc suivant :
┌─────────────────────────────────────────────────────┐
│ Gated DeltaNet → MoE (512 experts, 10 actifs) │ ×3
│ Gated DeltaNet → MoE │
│ Gated DeltaNet → MoE │
├─────────────────────────────────────────────────────┤
│ Attention complète gatée → MoE │ ×1
└─────────────────────────────────────────────────────┘
× 23
Soit, dans les termes de la carte de modèle :
23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE))
Deux observations immédiates :
- Toutes les couches, sans exception, ont un bloc MoE. Il n'y a aucune couche dense dans le modèle.
- Le mélange se fait au niveau du mécanisme d'attention uniquement.
Le chemin d'un jeton¶
jeton d'entrée (un entier parmi 248 320)
│
▼
[ table d'embeddings 248 320 × 8 192 ] 2,03 G de paramètres
│
▼ vecteur de dimension 8 192
┌────────────────────────────────────┐
│ couche 1 : DeltaNet → MoE │ 438 M + 25,8 G
│ couche 2 : DeltaNet → MoE │
│ couche 3 : DeltaNet → MoE │
│ couche 4 : ATTENTION → MoE │ 419 M + 25,8 G
│ … │
│ couche 92 : ATTENTION → MoE │
└────────────────────────────────────┘
│
▼
[ normalisation finale ]
│
▼
[ tête de sortie 8 192 × 248 320 ] 2,03 G de paramètres
│
▼
248 320 probabilités — une par jeton du vocabulaire
À cela s'ajoute, en parallèle de la tête principale, une couche de prédiction multi-jetons — voir le chapitre 05.
Où sont les paramètres¶
C'est le tableau qui explique tout le reste.
| Composant | Nombre | Par unité | Total | Part |
|---|---|---|---|---|
| Blocs MoE | 92 | 25,82 G | 2 375,8 G | 98,2 % |
| Couches DeltaNet | 69 | 438,4 M | 30,2 G | 1,25 % |
| Couches d'attention complète | 23 | 419,4 M | 9,6 G | 0,40 % |
| Table d'embeddings | 1 | 2,03 G | 2,03 G | 0,08 % |
| Tête de sortie | 1 | 2,03 G | 2,03 G | 0,08 % |
| Normalisations | 185 | 8 192 | 1,5 M | ~0 % |
| Total | 2 419,8 G | 100 % | ||
| Couche MTP | 1 | 26,24 G | 26,2 G | en sus |
| Total livré | 2 446,0 G |
Le modèle est un MoE avec un peu d'attention autour
98,2 % des paramètres sont dans les experts. Toute l'ingénierie de l'attention — hybride, GQA, portes, RoPE partiel — porte sur 1,65 % du modèle.
Cela ne veut pas dire que l'attention est secondaire : c'est elle qui décide de la vitesse et de la faisabilité du contexte long. Mais la capacité, au sens de ce que le modèle a mémorisé, est presque entièrement dans les experts.
Où va le calcul¶
Par jeton, tout change :
| Composant | Paramètres actifs | Part |
|---|---|---|
| Blocs MoE (11 experts sur 513) | 51,3 G | 53,9 % |
| Couches DeltaNet | 30,2 G | 31,7 % |
| Couches d'attention complète | 9,6 G | 10,1 % |
| Tête de sortie + embeddings | 4,07 G | 4,3 % |
| Total actif | 95,29 G | 100 % |
Le renversement
Les blocs MoE représentent 98,2 % du stockage mais 53,9 % du calcul. Les couches d'attention, 1,65 % du stockage, en pèsent 41,8 %.
Autrement dit : le MoE est là pour la mémoire, l'attention pour le travail.
Pourquoi ce ratio 3:1¶
L'arbitrage se lit dans les chiffres, même sans justification publiée.
| Si toutes les couches étaient… | Calcul à 1 M jetons | Cache KV à 1 M | Rappel exact |
|---|---|---|---|
| complètes | prohibitif (\(O(n^2)\) × 92) | 381 Go | excellent |
| linéaires | linéaire | ~0 | dégradé |
| 3:1 (réel) | \(O(n^2)\) × 23 seulement | 95,2 Go | conservé |
Le ratio 3:1 est le choix devenu standard en 2026 : on le retrouve dans Qwen3-Next et, sous des formes voisines, dans plusieurs modèles hybrides récents.
Aucune ablation n'est publiée
Rien ne démontre que 3:1 soit optimal. Ce pourrait être 2:1, 5:1 ou variable selon la profondeur. Alibaba n'a publié aucune comparaison.
Ce que l'on peut dire : le choix est cohérent avec l'objectif affiché, et conforme à ce que fait le reste de l'industrie.
Les nombres qui sortent de l'ordinaire¶
Trois valeurs de config.json méritent d'être signalées parce qu'elles
s'écartent des conventions.
Une dimension de tête de 256¶
head_dim: 256, alors que la valeur usuelle est 128. Les têtes sont deux fois
plus « larges » que la norme. Avec seulement 4 têtes clé-valeur, cela maintient
une dimension de cache raisonnable — \(4 \times 256 = 1\,024\) — tout en donnant
à chaque tête un espace de représentation plus riche.
Un vocabulaire de 248 320¶
Contre 128 000 pour Llama 3 et environ 160 000 pour Kimi K3. Un vocabulaire presque deux fois plus grand découpe le texte en moins de jetons — un avantage direct sur le coût et la longueur effective du contexte, particulièrement pour le chinois et le code.
Une base RoPE de 10 000 000¶
Contre 10 000 dans le Transformer d'origine. Cette base élevée est ce qui permet aux positions de rester distinguables sur des centaines de milliers de jetons. Voir le chapitre 03.
À retenir¶
Ce chapitre en cinq points
- Le modèle est 23 répétitions de (3 couches DeltaNet + 1 couche d'attention complète), chacune suivie d'un bloc MoE.
- 98,2 % des paramètres sont dans les blocs MoE ; 53,9 % du calcul par jeton l'est aussi.
- L'attention représente 1,65 % du stockage mais 41,8 % du calcul.
- Le ratio 3:1 est le compromis entre coût quadratique et rappel exact. Aucune ablation ne le justifie publiquement.
- Trois valeurs sortent de l'ordinaire :
head_dimà 256, vocabulaire à 248 320, base RoPE à 10⁷.
Chapitre suivant : Gated DeltaNet — les 69 couches qui font le gros du travail.