Aller au contenu

Fondations : comprendre les LLM avant Kimi K3

Cette partie est le cours d'entrée du wiki. Elle suppose zéro connaissance préalable en apprentissage automatique, et elle n'a qu'un seul objectif : rendre lisible chaque phrase du rapport technique de Kimi K3.

Tout ce qui est expliqué ici est utilisé plus loin. Rien n'est ajouté par tradition pédagogique. Inversement, chaque notion utilisée dans les parties architecture, entraînement et infrastructure est définie ici.

Comment lire cette partie

Les chapitres se lisent dans l'ordre. Chacun n'utilise que le vocabulaire des chapitres précédents. Si un terme vous échappe, il est dans le glossaire.

Ce que vous saurez faire à la fin

  • Expliquer ce que calcule un modèle de langage, ligne par ligne.
  • Lire une formule d'attention et dire ce que chaque symbole représente.
  • Comprendre pourquoi un modèle à 2 800 milliards de paramètres n'en utilise que 104 milliards par jeton.
  • Comprendre pourquoi la longueur de contexte coûte cher, et par quels moyens on la rend abordable.
  • Distinguer pré-entraînement, ajustement supervisé, apprentissage par renforcement et distillation.
  • Savoir ce qu'est un GPU, une matrice de poids, un cache KV, une quantification.

Les treize chapitres

# Chapitre Question à laquelle il répond
01 Qu'est-ce qu'un modèle de langage ? Que fait réellement un LLM ?
02 Jetons et tokenisation Comment le texte devient des nombres
03 Vecteurs, embeddings, espaces de représentation Comment un mot devient une direction
04 Les briques d'un réseau de neurones Matrices, activations, normalisations, résidus
05 Le Transformer et l'attention Le cœur de tous les LLM modernes
06 Attention linéaire et récurrence Comment échapper au coût quadratique
07 Mixture-of-Experts Beaucoup de paramètres, peu de calcul
08 Entraînement et lois d'échelle Descente de gradient, optimiseurs, budget de calcul
09 Post-entraînement : SFT, RL, distillation Comment on passe d'un modèle brut à un assistant
10 Inférence : cache KV, décodage, quantification Ce qui se passe quand vous appuyez sur Entrée
11 Matériel et parallélismes Comment on répartit un modèle sur des milliers de GPU
12 Vision et multimodalité Comment une image entre dans un modèle de texte
13 Agents, outils et contexte long Ce que veut dire « agentique »

Trois idées à garder en tête dès maintenant

À retenir

  1. Un LLM prédit le jeton suivant. Tout le reste — raisonnement, code, appels d'outils — est une conséquence de cette tâche unique, apprise sur des quantités massives de texte.
  2. Tout est compromis entre calcul, mémoire et qualité. La quasi-totalité des innovations de Kimi K3 (KDA, LatentMoE, MXFP4, MoonEP) déplace un curseur sur ce triangle, sans en changer la nature.
  3. Un modèle moderne est autant un système distribué qu'un objet mathématique. Environ la moitié du rapport de Kimi K3 parle d'infrastructure, pas d'équations.

Où aller ensuite

Une fois cette partie lue, la suite naturelle est Présentation de Kimi K3, puis Architecture.

Si vous êtes déjà à l'aise avec les Transformers et le MoE, vous pouvez ne lire que les chapitres 06 (attention linéaire, indispensable pour KDA), 11 (parallélismes, indispensable pour l'infrastructure) et 13 (agents).