Aller au contenu

La lignée DeepSeek

DeepSeek-V4.1-Flash ne sort pas de nulle part. C'est la sixième génération d'une suite qui poursuit le même objectif depuis 2023 : faire baisser le coût de l'attention, d'abord en calcul, puis en mémoire.

Ce chapitre situe le modèle dans cette lignée. Il n'est pas nécessaire pour comprendre l'architecture, mais il explique pourquoi chaque mécanisme existe.

Le fil conducteur en un tableau

Génération Date Innovation pour l'attention et le cache Cache global par jeton
DeepSeek-V1 67B nov. 2023 GQA classique, 95 couches ≈ 380 Kio
DeepSeek-V2 mai 2024 MLA — un latent clé-valeur partagé entre toutes les têtes ≈ 60–70 Kio
DeepSeek-V3 / R1 déc. 2024 / janv. 2025 MLA + DeepSeekMoE, prédiction multi-jetons, FP8 ≈ 35 Kio
DeepSeek-V3.2 déc. 2025 DSA — indexeur léger et sélection Top-K 48 068 o
DeepSeek-V4 Pro / Flash avr. 2026 CSA (×4) et HCA (×128) alternées, SWA 128, mHC, Muon, experts FP4 3 514 o
DeepSeek-V4.1-Flash sept. 2026 CED, CSA2, cache FP4, SWA Bounded Replay, Engram, DSpark 890 o

Les quatre dernières valeurs sont celles publiées par DeepSeek dans la figure 1(b) de son rapport. La première est recalculée et retrouvée exactement — voir Le cache KV en FP4.

Les trois temps de cette histoire

2023–2024 : réduire la taille d'une entrée

MLA, introduit avec V2, remplace une clé et une valeur par tête par un unique vecteur latent partagé, décompressé à la volée. C'est un gain d'un facteur 6 environ, obtenu sans toucher au nombre de couches ni au nombre d'entrées.

C'est la première des trois dimensions de compression.

2025 : réduire le calcul, pas encore la mémoire

DSA, dans V3.2, introduit la sélection creuse : un indexeur léger score les positions et n'en retient qu'une poignée. Le coût de calcul de l'attention devient sous-linéaire en la longueur du contexte.

Mais le cache, lui, ne bouge pas : il faut toujours stocker toutes les positions pour pouvoir en choisir quelques-unes. Le goulet d'étranglement se déplace du calcul vers la mémoire.

2026 : réduire la mémoire

V4 attaque la deuxième dimension — la dimension séquentielle — en compressant plusieurs jetons en une entrée, avec deux régimes alternés : CSA à ratio 4 et HCA à ratio 128.

V4.1 attaque la troisième — la dimension des couches — et achève les deux autres :

  • couches : 4 couches sources sur 40 au lieu de 41 sur 43 ;
  • entrée : FP4 au lieu de FP8 ;
  • séquence : ratio 2 dans l'encodeur, et l'abandon de l'hybride CSA/HCA.

C'est le premier modèle de la lignée à exploiter les trois simultanément.

Ce que V4 avait posé, et que V4.1 simplifie

Le rapport de V4.1 se lit en grande partie comme une liste de simplifications de V4. Il est utile de savoir ce qui a été retiré :

Élément de V4 Sort dans V4.1
Hybride CSA / HCA supprimé — pur CSA2
Groupes de compression chevauchants (2m jetons par entrée) supprimés — groupes disjoints
Plongement positionnel absolu dans le compresseur supprimé
Voie de compression séparée pour les clés d'indexeur supprimée — projetées depuis le cache principal
Cache principal en FP8 passé en FP4
mHC multi-noyau décalé d'un bloc pour permettre la fusion
MTP entraîné avec le squelette remplacé par DSpark, entraîné après
« Zero SWA Caching » remplacé par le rejeu borné

Ce dernier point mérite d'être souligné : V4 avait déjà proposé de recalculer le cache de fenêtre glissante manquant plutôt que de le stocker. Le rapport de V4.1 constate que cette proposition « s'est révélée prohibitive dans les déploiements de production », parce qu'elle exigeait une passe complète sur \(L \times n_{\text{win}}\) jetons.

SWA Bounded Replay est la correction d'une idée de la génération précédente, pas une idée neuve : la nouveauté est d'accepter une reconstruction approchée là où V4 voulait l'exactitude. Voir SWA Bounded Replay.

Le calendrier de la sortie

Date Événement
26 avril 2026 Rapport DeepSeek-V4 ; V4-Pro et V4-Flash en préversion
27 juillet 2026 Kimi K3 (Moonshot) — 2,8 T de paramètres, 104 G actifs
31 juillet 2026 Mise à jour V4-Flash-0731
14 août 2026 GLM-5.3 (Zhipu) — ≈ 744 G, 40 G actifs
10 septembre 2026, 04:00 UTC V4.1-Flash : poids MIT, rapport technique, nouveaux tarifs
14 septembre 2026, 04:00 UTC deepseek-v4-pro routé vers V4.1-Flash, jusqu'à V4.1-Pro

Le détail commercial est au chapitre L'API et ses tarifs.

À retenir

Aucun des mécanismes de V4.1 n'est isolément révolutionnaire, et DeepSeek cite honnêtement ses antécédents — YoCo pour le CED, IndexCache, YOIO et HySparse pour le partage entre couches, NVFP4 pour le format de cache.

Ce qui est nouveau, c'est la composition : les trois dimensions de compression exploitées ensemble, entraînées de bout en bout, avec les approximations apprises plutôt que subies.


Partie suivante : Architecture