Fondations¶
Le cours d'entrée. Six chapitres, aucun prérequis, et à la fin vous pouvez
lire config.json ligne par ligne.
À quoi sert cette partie¶
Le reste du rapport parle d'attention linéaire gatée, de routage à 512 experts, de cache clé-valeur et de quantification FP8. Ces mots ne veulent rien dire tant qu'on n'a pas construit ce qu'il y a dessous.
Cette partie les construit. Elle ne suppose ni connaissance en apprentissage automatique, ni mathématiques au-delà du lycée. Elle suppose seulement que vous acceptez de lire des formules — définies symbole par symbole à chaque fois.
Le fil conducteur
Chaque chapitre se termine sur ce qu'il permet de comprendre dans Qwen3.8-Max précisément. À la fin des six, le fichier de configuration du modèle est entièrement lisible.
L'ordre recommandé¶
Les chapitres se lisent dans l'ordre : chacun utilise le vocabulaire du précédent.
01 · Qu'est-ce qu'un grand modèle de langage¶
Prédire le mot suivant, et pourquoi cela suffit. Jetons, vocabulaire, probabilités. Ce que veut dire « 2,4 billions de paramètres ».
~20 min · ★☆☆
02 · Le Transformer et l'attention¶
Le mécanisme central de tous les modèles modernes, expliqué depuis l'intuition jusqu'à la formule. Et son défaut : le coût quadratique.
~30 min · ★★☆
03 · L'attention linéaire et DeltaNet¶
Comment remplacer le coût quadratique par un coût linéaire, ce qu'on y perd, et pourquoi les modèles récents mélangent les deux.
~30 min · ★★★
04 · Le Mixture-of-Experts¶
Comment un modèle peut avoir 2,4 billions de paramètres et n'en utiliser que 95 milliards à chaque jeton. Routage, experts partagés, équilibrage.
~25 min · ★★☆
05 · Le cache clé-valeur et le contexte long¶
Pourquoi une longue conversation coûte de la mémoire, comment on calcule combien, et pourquoi c'est le vrai facteur limitant du contexte long.
~20 min · ★★☆
06 · Quantification et matériel¶
BF16, FP8, 4 bits : ce que chaque format coûte et ce qu'il abîme. Combien de GPU pour combien de paramètres.
~20 min · ★★☆
Ce que cette partie ne couvre pas¶
Volontairement absents, parce qu'ils ne sont pas nécessaires pour lire ce rapport :
- les détails de l'entraînement par descente de gradient ;
- l'apprentissage par renforcement et l'alignement ;
- la vision par ordinateur et les encodeurs multimodaux.
Pour le premier et le deuxième, le rapport sur Kimi K3 les traite en détail. Pour le troisième, il n'y a rien à dire ici : les poids ouverts de Qwen3.8-Max sont textuels.
Si vous connaissez déjà tout cela¶
Passez directement à Architecture · Vue d'ensemble.
Test rapide : si les phrases « l'attention linéaire remplace la somme pondérée sur tout l'historique par un état récurrent de taille fixe » et « seules les couches d'attention complète produisent un cache KV » vous paraissent évidentes, vous pouvez sauter cette partie.