Architecture¶
Le cœur du rapport. Six chapitres tirés d'un seul fichier de 60 lignes.
Une remarque de méthode, d'abord¶
Il n'existe pas de rapport technique sur Qwen3.8-Max. Le communiqué dit « architecture Mixture-of-Experts creuse combinée à un mécanisme d'attention hybride », et s'arrête là.
Tout ce qui suit est donc reconstruit à partir d'une seule source :
config.json,
le fichier de configuration livré avec les poids.
Ce que cette contrainte a de bon
Un config.json ne peut pas exagérer. Il ne contient aucune formulation
marketing, aucune revendication invérifiable. Il décrit exactement ce que le
code va instancier — sans quoi le modèle ne se chargerait pas.
Là où un rapport technique demande d'être cru sur parole, un fichier de configuration se lit et se recalcule. C'est une source plus fiable, pas moins.
Ce que cette contrainte a de mauvais
Un config.json dit quoi, jamais pourquoi. Pourquoi 3:1 et non
5:1 ? Pourquoi 512 experts et non 256 ? Pourquoi une dimension de tête de
256, deux fois la valeur usuelle ?
Ces questions restent sans réponse, et ce rapport ne les invente pas. Elles sont rassemblées en Questions ouvertes.
Ce que vous saurez à la fin¶
- Le motif exact des 92 couches, et pourquoi ce motif existe.
- Le fonctionnement de Gated DeltaNet dans le détail de ses projections.
- Ce que la « porte de sortie » ajoute à l'attention classique.
- Comment 512 experts se réduisent à 11 par jeton.
- Ce que fait la couche de prédiction multi-jetons, et pourquoi elle explique l'écart de 26 Go entre le calcul et la taille du dépôt.
- Le coût mémoire réel du contexte long, chiffré.
Les six chapitres¶
01 · Vue d'ensemble¶
Le chapitre le plus rentable du rapport. La structure complète en un schéma et un tableau. Si vous n'en lisez qu'un, lisez celui-là.
~15 min · ★★☆
02 · Gated DeltaNet¶
Les 69 couches d'attention linéaire : projections, convolution causale, règle delta, état récurrent. Avec les dimensions réelles.
~25 min · ★★★★
03 · L'attention complète gatée¶
Les 23 couches d'ancrage : GQA à 16:1, dimension de tête inhabituelle, RoPE partiel, et la porte de sortie.
~20 min · ★★★
04 · Le MoE à 513 experts¶
Le routage, l'expert partagé, l'équilibrage, et pourquoi 98 % des paramètres tiennent ici.
~20 min · ★★★
05 · La prédiction multi-jetons¶
La couche MTP : ce qu'elle fait, ce qu'elle coûte, et comment sa présence a été établie par un simple calcul de taille de dépôt.
~15 min · ★★★
06 · Contexte 262 K et 1 M¶
L'arithmétique du contexte long : cache KV, état récurrent, et l'économie de 75 % que l'architecture hybride procure.
~20 min · ★★★
Prérequis¶
Cette partie suppose acquis les chapitres 02, 03, 04 et 05 des Fondations.
Chaque notion utilisée renvoie au chapitre qui l'introduit. Faire l'aller-retour est prévu.
La configuration, en entier¶
Pour référence, voici le fichier commenté — layer_types abrégé, le reste
intégral.
{
"architectures": ["Qwen3_5MoeForCausalLM"], // code de Qwen3.5 réutilisé
"model_type": "qwen3_5_moe_text", // "_text" : pas de vision
"hidden_size": 8192,
"num_hidden_layers": 92,
"vocab_size": 248320,
"tie_word_embeddings": false,
// — attention complète —
"num_attention_heads": 64,
"num_key_value_heads": 4, // GQA 16:1
"head_dim": 256,
"attn_output_gate": true,
"partial_rotary_factor": 0.25, // RoPE sur 64 des 256 dims
"rope_parameters": { "rope_theta": 10000000 },
// — attention linéaire (Gated DeltaNet) —
"linear_num_value_heads": 128,
"linear_num_key_heads": 16,
"linear_key_head_dim": 128,
"linear_value_head_dim": 128,
"linear_conv_kernel_dim": 4,
"output_gate_type": "swish",
"mamba_ssm_dtype": "float32",
// — alternance —
"full_attention_interval": 4, // 3 linéaires, 1 complète
"layer_types": ["linear_attention", "linear_attention",
"linear_attention", "full_attention", …], // 92 entrées
// — Mixture-of-Experts —
"num_experts": 512,
"num_experts_per_tok": 10,
"moe_intermediate_size": 2048,
"shared_expert_intermediate_size": 2048,
"router_aux_loss_coef": 0.001,
// — décodage —
"mtp_num_hidden_layers": 1,
"mtp_use_dedicated_embeddings": false,
"max_position_embeddings": 262144,
"hidden_act": "silu",
"rms_norm_eps": 1e-06,
"dtype": "bfloat16"
}
Commencer : Vue d'ensemble.