Aller au contenu

Architecture

Cette partie décrit les huit composants qui distinguent DeepSeek-V4.1-Flash d'un Transformer MoE ordinaire. Deux d'entre eux — le CED et CSA2 — portent l'essentiel du gain revendiqué ; les autres sont des extensions d'efficacité héritées ou reprises de travaux antérieurs de DeepSeek.

Ce que vous allez apprendre

  • Vue d'ensemble — la carte des 40 couches, quelle couche fait quoi, et d'où viennent les 552 G de paramètres.
  • L'encodeur-décodeur causal — comment couper un modèle décodeur en deux moitiés divise le préremplissage par deux.
  • CSA2 — les trois modes Full, Reindex, Reuse, et pourquoi quatre couches suffisent à alimenter les quarante.
  • L'indexeur hiérarchique — comment borner le coût d'indexation indépendamment de la longueur du contexte.
  • Le cache KV en FP4 — le calcul complet des 890 octets par jeton, vérifié.
  • Single-Pass mHC, Engram, DSpark — les trois extensions d'efficacité.
  • La voie visuelle — DeepSeek-ViT et l'intégration multimodale.

Ordre recommandé

L'ordre ci-dessus est celui du rapport technique, et il est aussi celui de la dépendance logique : CSA2 se comprend mieux après le CED, parce que le CED change la provenance du cache dans le décodeur ; le chapitre sur le FP4 rassemble les résultats des deux précédents en un seul calcul.

Les chapitres 6 et 7 sont indépendants du reste.

Le principe directeur

Le rapport technique donne une clé de lecture utile pour toute cette partie :

Section 1 du rapport technique

« Conceptuellement, DeepSeek-V4 peut être vu comme un squelette de traitement local à base de fenêtre glissante, augmenté d'un contexte global compressé. Cette perspective nous a conduits à nous concentrer sur la simplification de la branche globale tout en préservant largement la conception de l'attention locale. »

Autrement dit : la voie locale est intouchée, tout le travail porte sur la voie globale. Chaque mécanisme de cette partie s'inscrit dans cette division.


Partie précédente : Fondations