Glossaire¶
Architecture¶
Cache clé-valeur (KV cache). Les vecteurs clé et valeur conservés pour chaque jeton déjà traité, afin d'éviter de les recalculer à chaque nouveau jeton. Voir Fondations · Le cache clé-valeur.
Cache global. Dans DeepSeek-V4.1-Flash, le cache principal plus les clés d'indexeur. Il doit rester en mémoire vive graphique pendant la génération et vaut 890 octets par jeton.
Cache persistant. Le cache écrit sur SSD ou en mémoire hôte entre deux tours de conversation, pour réutiliser un préfixe déjà traité.
CED (Causal Encoder-Decoder). Architecture où les 20 premières couches forment un encodeur causal et les 20 suivantes un décodeur dont le cache global est projeté depuis la sortie de l'encodeur. Divise le préremplissage par deux.
Compresseur. Le module qui agrège \(m\) jetons consécutifs en une seule entrée de cache, par somme pondérée d'une porte apprise.
CSA2 (Compressed Sparse Attention 2). Le mécanisme d'attention creuse compressée de V4.1, à trois modes statiques.
DSpark. Le module de décodage spéculatif : trois blocs de brouillon, génération semi-autorégressive de cinq positions, tête de Markov, tête de confiance, ordonnanceur de longueur de vérification.
Engram. Module de mémoire conditionnelle. Tables de correspondance gigantesques (196 G de paramètres) adressées par hachage de n-grammes, donc consultées sans calcul matriciel.
Full / Reindex / Reuse. Les trois modes de CSA2. Full calcule tout, Reindex partage le cache mais recalcule les indices, Reuse partage tout.
Indexeur. La petite attention auxiliaire qui score les positions du cache et en retient les 512 meilleures pour chaque requête.
Indexeur hiérarchique. Mécanisme du décodeur où la première couche Full construit un vivier de 16 384 positions candidates dans lequel les couches Reindex ultérieures cherchent, bornant leur coût indépendamment du contexte.
mHC (multi-stream Hyper-Connections). Généralisation de la connexion résiduelle à \(n\) flux parallèles entre blocs, avec des coefficients de mélange prédits par jeton. \(n = 4\) ici.
Mode Reuse. Voir Full / Reindex / Reuse.
MoE (Mixture-of-Experts). Architecture où le réseau feed-forward est remplacé par un ensemble d'experts dont seuls quelques-uns sont activés par jeton. Ici 6 routés sur 384, plus 1 partagé.
Ratio de compression. Le nombre de jetons agrégés en une entrée de cache. 2 dans l'encodeur, 1 dans le décodeur.
Single-Pass mHC. Variante de mHC où les coefficients de mélange d'entrée sont décalés d'un bloc, ce qui supprime une dépendance de données et permet la fusion en un seul noyau.
SWA (Sliding Window Attention). Attention limitée aux \(n_{\text{win}}\) jetons précédents. \(n_{\text{win}} = 128\) ici, dans toutes les couches.
SWA Bounded Replay. Reconstruction approchée du cache de fenêtre glissante en ne rejouant que les 128 derniers jetons au lieu de 5 120.
YaRN. Méthode d'extension de la fenêtre de contexte par modification de l'encodage positionnel rotatif. Facteur 16 ici, de 65 536 à 1 048 576.
Formats numériques¶
BF16. Flottant sur 16 bits, format E8M7.
E2M1. Flottant sur 4 bits : 1 bit de signe, 2 d'exposant, 1 de mantisse. Seize valeurs représentables.
E4M3. Flottant sur 8 bits, utilisé ici pour les facteurs d'échelle du cache principal et pour les poids denses.
E8M0. Format d'échelle sur 8 bits représentant uniquement des puissances de deux. Utilisé par MXFP4.
Facteur d'échelle par bloc. Valeur en pleine précision associée à un bloc de canaux, par laquelle les valeurs quantifiées du bloc sont multipliées.
MXFP4. Standard de l'Open Compute Project : E2M1 avec une échelle E8M0 par bloc de 32. Coût réel : 4,25 bits par canal.
NVFP4. Format NVIDIA : E2M1 avec une échelle E4M3 par bloc de 16 plus une échelle globale par tenseur. DeepSeek en reprend la structure sans l'échelle globale, soit 4,5 bits par canal.
QAT (Quantization-Aware Training). Entraînement simulant la quantification, pour que le modèle apprenne des représentations robustes à l'arrondi.
Entraînement¶
BPB (bits par octet). Mesure de perplexité normalisée par octet, comparable entre tokeniseurs différents. Plus bas est meilleur.
Distillation sur politique (OPD). Entraînement d'un modèle élève sur ses propres générations, corrigées par les distributions d'un ou plusieurs modèles enseignants.
DSec (DeepSeek Elastic Compute). La plateforme de bacs à sable de DeepSeek, capable de millions de conteneurs concurrents.
Équilibrage sans perte auxiliaire. Méthode d'équilibrage de charge du MoE par biais de correction ajouté aux scores de sélection uniquement, sans terme ajouté à la fonction de coût.
Équilibrage de Sinkhorn. Procédure normalisant alternativement les lignes et les colonnes d'une matrice jusqu'à convergence. Utilisée ici comme substitut à l'orthogonalisation dans un optimiseur de type Muon.
Effort de raisonnement. Entier de 1 à 100 transmis dans le prompt, contrôlant la longueur du raisonnement. Appris pendant l'apprentissage par renforcement via une pénalité de longueur décroissant exponentiellement avec l'effort.
GRPO. Méthode d'apprentissage par renforcement où les avantages sont calculés relativement à un groupe de réponses au même prompt.
Hors-politique (off-policy). Se dit d'échantillons générés par une version antérieure du modèle à celle en cours d'entraînement.
Muon. Optimiseur appliquant une orthogonalisation approchée du gradient par itération de Newton-Schulz.
Muon par tête. Variante appliquant un préconditionneur distinct à chaque tête d'attention.
Piratage de récompense (reward hacking). Comportement d'un agent qui maximise la récompense sans accomplir la tâche — par exemple en modifiant les tests plutôt que le code.
SFT (Supervised Fine-Tuning). Affinage supervisé sur des exemples de réponses de référence.
Évaluation et déploiement¶
Almost@1. Fraction des exécutions individuelles atteignant un score d'au moins 0,95.
EPD (Encoder–Prefill–Decode disaggregation). Séparation en trois pools de ressources indépendants : encodage visuel, préremplissage, décodage.
Harnais (scaffold). Le cadre logiciel qui entoure un modèle pour en faire un agent : prompts système, définitions d'outils, gestion du contexte, protocole de tours.
Pass@1. Fraction des tâches résolues au premier essai.
Préremplissage (prefill). La phase de traitement du prompt d'entrée, avant la génération du premier jeton.
Décodage (decode). La phase de génération, un jeton à la fois.