Fondations : comprendre les LLM avant Kimi K3¶
Cette partie est le cours d'entrée du wiki. Elle suppose zéro connaissance préalable en apprentissage automatique, et elle n'a qu'un seul objectif : rendre lisible chaque phrase du rapport technique de Kimi K3.
Tout ce qui est expliqué ici est utilisé plus loin. Rien n'est ajouté par tradition pédagogique. Inversement, chaque notion utilisée dans les parties architecture, entraînement et infrastructure est définie ici.
Comment lire cette partie
Les chapitres se lisent dans l'ordre. Chacun n'utilise que le vocabulaire des chapitres précédents. Si un terme vous échappe, il est dans le glossaire.
Ce que vous saurez faire à la fin¶
- Expliquer ce que calcule un modèle de langage, ligne par ligne.
- Lire une formule d'attention et dire ce que chaque symbole représente.
- Comprendre pourquoi un modèle à 2 800 milliards de paramètres n'en utilise que 104 milliards par jeton.
- Comprendre pourquoi la longueur de contexte coûte cher, et par quels moyens on la rend abordable.
- Distinguer pré-entraînement, ajustement supervisé, apprentissage par renforcement et distillation.
- Savoir ce qu'est un GPU, une matrice de poids, un cache KV, une quantification.
Les treize chapitres¶
| # | Chapitre | Question à laquelle il répond |
|---|---|---|
| 01 | Qu'est-ce qu'un modèle de langage ? | Que fait réellement un LLM ? |
| 02 | Jetons et tokenisation | Comment le texte devient des nombres |
| 03 | Vecteurs, embeddings, espaces de représentation | Comment un mot devient une direction |
| 04 | Les briques d'un réseau de neurones | Matrices, activations, normalisations, résidus |
| 05 | Le Transformer et l'attention | Le cœur de tous les LLM modernes |
| 06 | Attention linéaire et récurrence | Comment échapper au coût quadratique |
| 07 | Mixture-of-Experts | Beaucoup de paramètres, peu de calcul |
| 08 | Entraînement et lois d'échelle | Descente de gradient, optimiseurs, budget de calcul |
| 09 | Post-entraînement : SFT, RL, distillation | Comment on passe d'un modèle brut à un assistant |
| 10 | Inférence : cache KV, décodage, quantification | Ce qui se passe quand vous appuyez sur Entrée |
| 11 | Matériel et parallélismes | Comment on répartit un modèle sur des milliers de GPU |
| 12 | Vision et multimodalité | Comment une image entre dans un modèle de texte |
| 13 | Agents, outils et contexte long | Ce que veut dire « agentique » |
Trois idées à garder en tête dès maintenant¶
À retenir
- Un LLM prédit le jeton suivant. Tout le reste — raisonnement, code, appels d'outils — est une conséquence de cette tâche unique, apprise sur des quantités massives de texte.
- Tout est compromis entre calcul, mémoire et qualité. La quasi-totalité des innovations de Kimi K3 (KDA, LatentMoE, MXFP4, MoonEP) déplace un curseur sur ce triangle, sans en changer la nature.
- Un modèle moderne est autant un système distribué qu'un objet mathématique. Environ la moitié du rapport de Kimi K3 parle d'infrastructure, pas d'équations.
Où aller ensuite¶
Une fois cette partie lue, la suite naturelle est Présentation de Kimi K3, puis Architecture.
Si vous êtes déjà à l'aise avec les Transformers et le MoE, vous pouvez ne lire que les chapitres 06 (attention linéaire, indispensable pour KDA), 11 (parallélismes, indispensable pour l'infrastructure) et 13 (agents).