Aller au contenu

Vue d'ensemble

Le modèle entier en un schéma, un motif et un tableau.


Le motif

Qwen3.8-Max empile 23 fois le bloc suivant :

┌─────────────────────────────────────────────────────┐
│  Gated DeltaNet  →  MoE   (512 experts, 10 actifs)  │  ×3
│  Gated DeltaNet  →  MoE                             │
│  Gated DeltaNet  →  MoE                             │
├─────────────────────────────────────────────────────┤
│  Attention complète gatée  →  MoE                   │  ×1
└─────────────────────────────────────────────────────┘
                      × 23

Soit, dans les termes de la carte de modèle :

23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE))

\[ 23 \times 4 = 92 \text{ couches} \qquad 23 \times 3 = 69 \text{ linéaires} \qquad 23 \times 1 = 23 \text{ complètes} \]

Deux observations immédiates :

  1. Toutes les couches, sans exception, ont un bloc MoE. Il n'y a aucune couche dense dans le modèle.
  2. Le mélange se fait au niveau du mécanisme d'attention uniquement.

Le chemin d'un jeton

   jeton d'entrée (un entier parmi 248 320)
        │
        ▼
   [ table d'embeddings  248 320 × 8 192 ]     2,03 G de paramètres
        │
        ▼  vecteur de dimension 8 192
   ┌────────────────────────────────────┐
   │  couche 1 : DeltaNet   → MoE       │   438 M  +  25,8 G
   │  couche 2 : DeltaNet   → MoE       │
   │  couche 3 : DeltaNet   → MoE       │
   │  couche 4 : ATTENTION  → MoE       │   419 M  +  25,8 G
   │  …                                 │
   │  couche 92 : ATTENTION → MoE       │
   └────────────────────────────────────┘
        │
        ▼
   [ normalisation finale ]
        │
        ▼
   [ tête de sortie  8 192 × 248 320 ]         2,03 G de paramètres
        │
        ▼
   248 320 probabilités — une par jeton du vocabulaire

À cela s'ajoute, en parallèle de la tête principale, une couche de prédiction multi-jetons — voir le chapitre 05.


Où sont les paramètres

C'est le tableau qui explique tout le reste.

Composant Nombre Par unité Total Part
Blocs MoE 92 25,82 G 2 375,8 G 98,2 %
Couches DeltaNet 69 438,4 M 30,2 G 1,25 %
Couches d'attention complète 23 419,4 M 9,6 G 0,40 %
Table d'embeddings 1 2,03 G 2,03 G 0,08 %
Tête de sortie 1 2,03 G 2,03 G 0,08 %
Normalisations 185 8 192 1,5 M ~0 %
Total 2 419,8 G 100 %
Couche MTP 1 26,24 G 26,2 G en sus
Total livré 2 446,0 G

Le modèle est un MoE avec un peu d'attention autour

98,2 % des paramètres sont dans les experts. Toute l'ingénierie de l'attention — hybride, GQA, portes, RoPE partiel — porte sur 1,65 % du modèle.

Cela ne veut pas dire que l'attention est secondaire : c'est elle qui décide de la vitesse et de la faisabilité du contexte long. Mais la capacité, au sens de ce que le modèle a mémorisé, est presque entièrement dans les experts.


Où va le calcul

Par jeton, tout change :

Composant Paramètres actifs Part
Blocs MoE (11 experts sur 513) 51,3 G 53,9 %
Couches DeltaNet 30,2 G 31,7 %
Couches d'attention complète 9,6 G 10,1 %
Tête de sortie + embeddings 4,07 G 4,3 %
Total actif 95,29 G 100 %

Le renversement

Les blocs MoE représentent 98,2 % du stockage mais 53,9 % du calcul. Les couches d'attention, 1,65 % du stockage, en pèsent 41,8 %.

Autrement dit : le MoE est là pour la mémoire, l'attention pour le travail.


Pourquoi ce ratio 3:1

L'arbitrage se lit dans les chiffres, même sans justification publiée.

Si toutes les couches étaient… Calcul à 1 M jetons Cache KV à 1 M Rappel exact
complètes prohibitif (\(O(n^2)\) × 92) 381 Go excellent
linéaires linéaire ~0 dégradé
3:1 (réel) \(O(n^2)\) × 23 seulement 95,2 Go conservé

Le ratio 3:1 est le choix devenu standard en 2026 : on le retrouve dans Qwen3-Next et, sous des formes voisines, dans plusieurs modèles hybrides récents.

Aucune ablation n'est publiée

Rien ne démontre que 3:1 soit optimal. Ce pourrait être 2:1, 5:1 ou variable selon la profondeur. Alibaba n'a publié aucune comparaison.

Ce que l'on peut dire : le choix est cohérent avec l'objectif affiché, et conforme à ce que fait le reste de l'industrie.


Les nombres qui sortent de l'ordinaire

Trois valeurs de config.json méritent d'être signalées parce qu'elles s'écartent des conventions.

Une dimension de tête de 256

head_dim: 256, alors que la valeur usuelle est 128. Les têtes sont deux fois plus « larges » que la norme. Avec seulement 4 têtes clé-valeur, cela maintient une dimension de cache raisonnable — \(4 \times 256 = 1\,024\) — tout en donnant à chaque tête un espace de représentation plus riche.

Un vocabulaire de 248 320

Contre 128 000 pour Llama 3 et environ 160 000 pour Kimi K3. Un vocabulaire presque deux fois plus grand découpe le texte en moins de jetons — un avantage direct sur le coût et la longueur effective du contexte, particulièrement pour le chinois et le code.

Une base RoPE de 10 000 000

Contre 10 000 dans le Transformer d'origine. Cette base élevée est ce qui permet aux positions de rester distinguables sur des centaines de milliers de jetons. Voir le chapitre 03.


À retenir

Ce chapitre en cinq points

  1. Le modèle est 23 répétitions de (3 couches DeltaNet + 1 couche d'attention complète), chacune suivie d'un bloc MoE.
  2. 98,2 % des paramètres sont dans les blocs MoE ; 53,9 % du calcul par jeton l'est aussi.
  3. L'attention représente 1,65 % du stockage mais 41,8 % du calcul.
  4. Le ratio 3:1 est le compromis entre coût quadratique et rappel exact. Aucune ablation ne le justifie publiquement.
  5. Trois valeurs sortent de l'ordinaire : head_dim à 256, vocabulaire à 248 320, base RoPE à 10⁷.

Chapitre suivant : Gated DeltaNet — les 69 couches qui font le gros du travail.