Fondations¶
Cette partie construit les quatre notions nécessaires pour lire l'architecture de DeepSeek-V4.1-Flash. Elle ne contient rien de spécifique à ce modèle : si vous savez déjà ce qu'est un cache clé-valeur, une attention creuse, un Mixture-of-Experts et un format FP4, passez directement à Architecture.
Ce que vous allez apprendre¶
- Le cache clé-valeur — pourquoi un modèle de langage doit mémoriser quelque chose pour chaque jeton lu, combien cela pèse, et pourquoi c'est devenu le goulet d'étranglement du contexte long.
- Attention creuse et fenêtre glissante — les deux grandes familles de solutions, ce qu'elles économisent et ce qu'elles perdent.
- Mixture-of-Experts — comment un modèle peut avoir 552 milliards de paramètres et n'en utiliser que 16 pour chaque jeton.
- FP8, FP4 et quantification — ce que signifie « stocker un nombre sur quatre bits », et ce qu'on y perd.
- La lignée DeepSeek — d'où vient ce modèle : six générations qui poursuivent le même objectif, et ce que V4.1 retire de V4.
Ordre recommandé¶
L'ordre ci-dessus est celui de la dépendance : le chapitre 2 suppose le chapitre 1, le chapitre 4 est indépendant des trois autres et peut être lu à n'importe quel moment. Le chapitre 5 est un chapitre de contexte : il éclaire les choix de conception sans être nécessaire pour les comprendre.
Un fil rouge chiffré
Chaque chapitre revient sur le même exemple : un contexte d'un million de jetons. À la fin de la partie, vous saurez pourquoi ce contexte coûte 380 Kio par jeton sur une architecture de 2023 et 890 octets sur DeepSeek-V4.1-Flash.