Aller au contenu

Vue d'ensemble

Le modèle entier en un schéma, un motif et un tableau.


Le motif

Qwen3.8-27B empile 16 fois le bloc suivant :

┌───────────────────────────────────────────────┐
│  Gated DeltaNet      →  réseau dense (SwiGLU) │  ×3
│  Gated DeltaNet      →  réseau dense          │
│  Gated DeltaNet      →  réseau dense          │
├───────────────────────────────────────────────┤
│  Attention complète  →  réseau dense          │  ×1
└───────────────────────────────────────────────┘
                     × 16
\[ 16 \times 4 = 64 \text{ couches} \qquad 16 \times 3 = 48 \text{ linéaires} \qquad 16 \times 1 = 16 \text{ complètes} \]

Deux observations immédiates :

  1. Le réseau qui suit l'attention est un réseau dense classique, de dimension intermédiaire 17 408. Il n'y a aucun Mixture-of-Experts : c'est la différence structurelle majeure avec le Max, dont les 92 couches sont toutes suivies d'un bloc à 513 experts.
  2. Le mélange se fait au niveau du mécanisme d'attention uniquement — même principe que le Max, même ratio.

Le ratio 3:1 est identique à celui du Max

full_attention_interval: 4 dans les deux fichiers de configuration. La recette architecturale de la génération 3.8 est descendue telle quelle de 2,4 billions à 27 milliards de paramètres.


Le chemin d'un jeton

   texte                          image / vidéo
     │                                  │
     ▼                                  ▼
 [ embeddings ]              [ encodeur visuel, 27 couches ]
 248 320 × 5 120                       │  1 152 → fusion → 5 120
   1,27 G                              │  0,46 G
     │                                  │
     └──────────────► (+) ◄─────────────┘
                       │  vecteurs de dimension 5 120
                       ▼
   ┌─────────────────────────────────────┐
   │  couche 1 : DeltaNet   → dense      │   116 M  +  267 M
   │  couche 2 : DeltaNet   → dense      │
   │  couche 3 : DeltaNet   → dense      │
   │  couche 4 : ATTENTION  → dense      │   105 M  +  267 M
   │  …                                  │
   │  couche 64 : ATTENTION → dense      │
   └─────────────────────────────────────┘
                       │
                       ▼
              [ normalisation finale ]
                       │
                       ▼
        [ tête de sortie  5 120 × 248 320 ]     1,27 G
                       │
                       ▼
          248 320 probabilités par jeton

En parallèle de la tête principale, une couche de prédiction multi-jetons (0,372 G) alimente le décodage spéculatif.


Où sont les paramètres

Composant Nombre Par unité Total Part
Réseaux denses 64 267,4 M 17,113 G 61,7 %
Couches DeltaNet 48 115,9 M 5,562 G 20,1 %
Couches d'attention complète 16 104,9 M 1,678 G 6,1 %
Table d'embeddings 1 1,271 G 1,271 G 4,6 %
Tête de sortie 1 1,271 G 1,271 G 4,6 %
Encodeur visuel 1 461 M 0,461 G 1,7 %
Couche MTP 1 372 M 0,372 G 1,3 %
Normalisations 129 5 120 0,001 G ~0 %
Total 27,729 G 100 %

Vérifié par le script joint : \(27{,}729 \times 2 = 55{,}46\) Go, contre 55,6 Go affichés par Hugging Face — écart de 0,26 %.

Ce que cet accord établit

L'encodeur visuel et la couche MTP sont bien présents dans les poids livrés, et leurs tailles reconstruites sont du bon ordre.

Ni la carte de modèle ni le communiqué ne les chiffrent.


La différence de nature avec le Max

C'est l'enseignement le plus intéressant de la comparaison.

Qwen3.8-Max Qwen3.8-27B
Réseau après l'attention MoE, 513 experts dense, 17 408
Part des paramètres dans ce réseau 98,2 % 61,7 %
Part du modèle activée par jeton 3,94 % 100 %
Couches 92 64
Ratio hybride 3:1 3:1
Dimension cachée 8 192 5 120
Dimension de tête 256 256
Têtes clé-valeur 4 4
Vocabulaire 248 320 248 320
Base RoPE \(10^7\) \(10^7\)
Contexte natif 262 144 262 144

Tout est partagé, sauf l'échelle et le MoE

Les deux modèles ont la même dimension de tête, le même nombre de têtes clé-valeur, le même vocabulaire, la même base RoPE, le même ratio hybride et le même contexte natif.

La seule divergence structurelle est le réseau qui suit l'attention : MoE creux à très grande échelle, dense à petite échelle.

C'est cohérent avec l'arbitrage du Mixture-of-Experts. Il échange de la mémoire contre du calcul : à 2,4 billions de paramètres, l'échange rapporte un facteur 46. À 27 milliards, il coûterait la seule chose qui compte pour ce modèle — la capacité à tenir sur une carte.


Les nombres qui sortent de l'ordinaire

Une dimension de tête de 256 pour 24 têtes seulement

head_dim: 256, contre 128 usuellement, et seulement 24 têtes de requête.

La dimension totale des requêtes vaut \(24 \times 256 = 6\,144\), soit 1,2 fois la dimension cachée de 5 120 — un rapport modeste. Le modèle privilégie des têtes larges et peu nombreuses.

Un GQA à 6:1, moins agressif que le Max

24 têtes de requête pour 4 têtes clé-valeur. Le Max est à 16:1.

Mais la dimension de cache est identique

Ce qui compte pour le cache n'est pas le ratio, c'est \(H_{kv} \times d_h\) :

Modèle Têtes KV Dim. de tête Produit
Qwen3.8-Max 4 256 1 024
Qwen3.8-27B 4 256 1 024

Les deux modèles stockent exactement 4 096 octets par jeton et par couche d'attention complète. Le 27B en a simplement 16 au lieu de 23.

Un réseau dense à 17 408

Rapport de \(17\,408 / 5\,120 = 3{,}4\) avec la dimension cachée — la valeur classique pour un SwiGLU, dont le rapport usuel se situe entre 2,7 et 4.

Rien d'exotique ici : c'est un Transformer dense tout à fait conventionnel, dont seule l'attention a été remplacée.


À retenir

Ce chapitre en cinq points

  1. 16 répétitions de (3 couches DeltaNet + 1 couche complète), chacune suivie d'un réseau dense — pas de MoE.
  2. Les réseaux denses concentrent 61,7 % des paramètres ; le modèle active 100 % de ses poids à chaque jeton.
  3. Le total recalculé, 27,729 G, retrouve la taille du dépôt à 0,26 % — ce qui confirme la présence de l'encodeur visuel et de la couche MTP.
  4. Le 27B partage avec le Max la dimension de tête, les têtes clé-valeur, le vocabulaire, la base RoPE, le ratio 3:1 et le contexte natif.
  5. Sa seule divergence structurelle est le réseau dense au lieu du MoE — et c'est ce qui lui permet de tenir sur une carte.

Chapitre suivant : L'attention hybride.