Aller au contenu

Fondations

Cette partie construit les quatre notions nécessaires pour lire l'architecture de DeepSeek-V4.1-Flash. Elle ne contient rien de spécifique à ce modèle : si vous savez déjà ce qu'est un cache clé-valeur, une attention creuse, un Mixture-of-Experts et un format FP4, passez directement à Architecture.

Ce que vous allez apprendre

  1. Le cache clé-valeur — pourquoi un modèle de langage doit mémoriser quelque chose pour chaque jeton lu, combien cela pèse, et pourquoi c'est devenu le goulet d'étranglement du contexte long.
  2. Attention creuse et fenêtre glissante — les deux grandes familles de solutions, ce qu'elles économisent et ce qu'elles perdent.
  3. Mixture-of-Experts — comment un modèle peut avoir 552 milliards de paramètres et n'en utiliser que 16 pour chaque jeton.
  4. FP8, FP4 et quantification — ce que signifie « stocker un nombre sur quatre bits », et ce qu'on y perd.
  5. La lignée DeepSeek — d'où vient ce modèle : six générations qui poursuivent le même objectif, et ce que V4.1 retire de V4.

Ordre recommandé

L'ordre ci-dessus est celui de la dépendance : le chapitre 2 suppose le chapitre 1, le chapitre 4 est indépendant des trois autres et peut être lu à n'importe quel moment. Le chapitre 5 est un chapitre de contexte : il éclaire les choix de conception sans être nécessaire pour les comprendre.

Un fil rouge chiffré

Chaque chapitre revient sur le même exemple : un contexte d'un million de jetons. À la fin de la partie, vous saurez pourquoi ce contexte coûte 380 Kio par jeton sur une architecture de 2023 et 890 octets sur DeepSeek-V4.1-Flash.