Aller au contenu

Fondations

Le cours d'entrée. Six chapitres, aucun prérequis, et à la fin vous pouvez lire config.json ligne par ligne.


À quoi sert cette partie

Le reste du rapport parle d'attention linéaire gatée, de routage à 512 experts, de cache clé-valeur et de quantification FP8. Ces mots ne veulent rien dire tant qu'on n'a pas construit ce qu'il y a dessous.

Cette partie les construit. Elle ne suppose ni connaissance en apprentissage automatique, ni mathématiques au-delà du lycée. Elle suppose seulement que vous acceptez de lire des formules — définies symbole par symbole à chaque fois.

Le fil conducteur

Chaque chapitre se termine sur ce qu'il permet de comprendre dans Qwen3.8-Max précisément. À la fin des six, le fichier de configuration du modèle est entièrement lisible.


L'ordre recommandé

Les chapitres se lisent dans l'ordre : chacun utilise le vocabulaire du précédent.

01 · Qu'est-ce qu'un grand modèle de langage

Prédire le mot suivant, et pourquoi cela suffit. Jetons, vocabulaire, probabilités. Ce que veut dire « 2,4 billions de paramètres ».

~20 min · ★☆☆

02 · Le Transformer et l'attention

Le mécanisme central de tous les modèles modernes, expliqué depuis l'intuition jusqu'à la formule. Et son défaut : le coût quadratique.

~30 min · ★★☆

03 · L'attention linéaire et DeltaNet

Comment remplacer le coût quadratique par un coût linéaire, ce qu'on y perd, et pourquoi les modèles récents mélangent les deux.

~30 min · ★★★

04 · Le Mixture-of-Experts

Comment un modèle peut avoir 2,4 billions de paramètres et n'en utiliser que 95 milliards à chaque jeton. Routage, experts partagés, équilibrage.

~25 min · ★★☆

05 · Le cache clé-valeur et le contexte long

Pourquoi une longue conversation coûte de la mémoire, comment on calcule combien, et pourquoi c'est le vrai facteur limitant du contexte long.

~20 min · ★★☆

06 · Quantification et matériel

BF16, FP8, 4 bits : ce que chaque format coûte et ce qu'il abîme. Combien de GPU pour combien de paramètres.

~20 min · ★★☆


Ce que cette partie ne couvre pas

Volontairement absents, parce qu'ils ne sont pas nécessaires pour lire ce rapport :

  • les détails de l'entraînement par descente de gradient ;
  • l'apprentissage par renforcement et l'alignement ;
  • la vision par ordinateur et les encodeurs multimodaux.

Pour le premier et le deuxième, le rapport sur Kimi K3 les traite en détail. Pour le troisième, il n'y a rien à dire ici : les poids ouverts de Qwen3.8-Max sont textuels.


Si vous connaissez déjà tout cela

Passez directement à Architecture · Vue d'ensemble.

Test rapide : si les phrases « l'attention linéaire remplace la somme pondérée sur tout l'historique par un état récurrent de taille fixe » et « seules les couches d'attention complète produisent un cache KV » vous paraissent évidentes, vous pouvez sauter cette partie.