La lignée DeepSeek¶
DeepSeek-V4.1-Flash ne sort pas de nulle part. C'est la sixième génération d'une suite qui poursuit le même objectif depuis 2023 : faire baisser le coût de l'attention, d'abord en calcul, puis en mémoire.
Ce chapitre situe le modèle dans cette lignée. Il n'est pas nécessaire pour comprendre l'architecture, mais il explique pourquoi chaque mécanisme existe.
Le fil conducteur en un tableau¶
| Génération | Date | Innovation pour l'attention et le cache | Cache global par jeton |
|---|---|---|---|
| DeepSeek-V1 67B | nov. 2023 | GQA classique, 95 couches | ≈ 380 Kio |
| DeepSeek-V2 | mai 2024 | MLA — un latent clé-valeur partagé entre toutes les têtes | ≈ 60–70 Kio |
| DeepSeek-V3 / R1 | déc. 2024 / janv. 2025 | MLA + DeepSeekMoE, prédiction multi-jetons, FP8 | ≈ 35 Kio |
| DeepSeek-V3.2 | déc. 2025 | DSA — indexeur léger et sélection Top-K | 48 068 o |
| DeepSeek-V4 Pro / Flash | avr. 2026 | CSA (×4) et HCA (×128) alternées, SWA 128, mHC, Muon, experts FP4 | 3 514 o |
| DeepSeek-V4.1-Flash | sept. 2026 | CED, CSA2, cache FP4, SWA Bounded Replay, Engram, DSpark | 890 o |
Les quatre dernières valeurs sont celles publiées par DeepSeek dans la figure 1(b) de son rapport. La première est recalculée et retrouvée exactement — voir Le cache KV en FP4.
Les trois temps de cette histoire¶
2023–2024 : réduire la taille d'une entrée¶
MLA, introduit avec V2, remplace une clé et une valeur par tête par un unique vecteur latent partagé, décompressé à la volée. C'est un gain d'un facteur 6 environ, obtenu sans toucher au nombre de couches ni au nombre d'entrées.
C'est la première des trois dimensions de compression.
2025 : réduire le calcul, pas encore la mémoire¶
DSA, dans V3.2, introduit la sélection creuse : un indexeur léger score les positions et n'en retient qu'une poignée. Le coût de calcul de l'attention devient sous-linéaire en la longueur du contexte.
Mais le cache, lui, ne bouge pas : il faut toujours stocker toutes les positions pour pouvoir en choisir quelques-unes. Le goulet d'étranglement se déplace du calcul vers la mémoire.
2026 : réduire la mémoire¶
V4 attaque la deuxième dimension — la dimension séquentielle — en compressant plusieurs jetons en une entrée, avec deux régimes alternés : CSA à ratio 4 et HCA à ratio 128.
V4.1 attaque la troisième — la dimension des couches — et achève les deux autres :
- couches : 4 couches sources sur 40 au lieu de 41 sur 43 ;
- entrée : FP4 au lieu de FP8 ;
- séquence : ratio 2 dans l'encodeur, et l'abandon de l'hybride CSA/HCA.
C'est le premier modèle de la lignée à exploiter les trois simultanément.
Ce que V4 avait posé, et que V4.1 simplifie¶
Le rapport de V4.1 se lit en grande partie comme une liste de simplifications de V4. Il est utile de savoir ce qui a été retiré :
| Élément de V4 | Sort dans V4.1 |
|---|---|
| Hybride CSA / HCA | supprimé — pur CSA2 |
| Groupes de compression chevauchants (2m jetons par entrée) | supprimés — groupes disjoints |
| Plongement positionnel absolu dans le compresseur | supprimé |
| Voie de compression séparée pour les clés d'indexeur | supprimée — projetées depuis le cache principal |
| Cache principal en FP8 | passé en FP4 |
| mHC multi-noyau | décalé d'un bloc pour permettre la fusion |
| MTP entraîné avec le squelette | remplacé par DSpark, entraîné après |
| « Zero SWA Caching » | remplacé par le rejeu borné |
Ce dernier point mérite d'être souligné : V4 avait déjà proposé de recalculer le cache de fenêtre glissante manquant plutôt que de le stocker. Le rapport de V4.1 constate que cette proposition « s'est révélée prohibitive dans les déploiements de production », parce qu'elle exigeait une passe complète sur \(L \times n_{\text{win}}\) jetons.
SWA Bounded Replay est la correction d'une idée de la génération précédente, pas une idée neuve : la nouveauté est d'accepter une reconstruction approchée là où V4 voulait l'exactitude. Voir SWA Bounded Replay.
Le calendrier de la sortie¶
| Date | Événement |
|---|---|
| 26 avril 2026 | Rapport DeepSeek-V4 ; V4-Pro et V4-Flash en préversion |
| 27 juillet 2026 | Kimi K3 (Moonshot) — 2,8 T de paramètres, 104 G actifs |
| 31 juillet 2026 | Mise à jour V4-Flash-0731 |
| 14 août 2026 | GLM-5.3 (Zhipu) — ≈ 744 G, 40 G actifs |
| 10 septembre 2026, 04:00 UTC | V4.1-Flash : poids MIT, rapport technique, nouveaux tarifs |
| 14 septembre 2026, 04:00 UTC | deepseek-v4-pro routé vers V4.1-Flash, jusqu'à V4.1-Pro |
Le détail commercial est au chapitre L'API et ses tarifs.
À retenir
Aucun des mécanismes de V4.1 n'est isolément révolutionnaire, et DeepSeek cite honnêtement ses antécédents — YoCo pour le CED, IndexCache, YOIO et HySparse pour le partage entre couches, NVFP4 pour le format de cache.
Ce qui est nouveau, c'est la composition : les trois dimensions de compression exploitées ensemble, entraînées de bout en bout, avec les approximations apprises plutôt que subies.
Partie suivante : Architecture