DeepSeek-V4.1-Flash¶
DeepSeek-AI · 10 septembre 2026 · licence MIT · poids ouverts
DeepSeek-V4.1-Flash est un Mixture-of-Experts multimodal de 552 milliards de paramètres dont 8 seulement sont activés par jeton pendant le préremplissage et 16 pendant le décodage, avec une fenêtre de contexte de 1 048 576 jetons.
Son objectif n'est pas la performance brute mais une grandeur que presque
personne ne met en avant : la taille du cache clé-valeur. DeepSeek annonce
890 octets par jeton — environ le quart de son prédécesseur DeepSeek-V4-Flash
et le 437ᵉ de DeepSeek-V1. Ce rapport recalcule ces deux chiffres depuis le seul
config.json publié et les retrouve exactement.
Objectif de ce rapport¶
Expliquer comment un modèle de 552 G de paramètres peut tenir un million de jetons de contexte dans moins d'un gibioctet de mémoire vive graphique, et à quel prix.
La réponse tient en quatre mécanismes qui se composent :
| Mécanisme | Ce qu'il attaque | Gain annoncé |
|---|---|---|
| CED (encodeur-décodeur causal) | calcul du préremplissage | ÷ 2 |
| CSA2 (attention creuse compressée 2) | nombre de couches qui stockent un cache | ÷ 4 sur le cache global |
| Cache KV en FP4 | précision de chaque entrée | ÷ 2 sur ce qui reste |
| SWA Bounded Replay | cache persistant sur SSD | ÷ 8 |
Chacun est traité dans un chapitre autonome, avec ses hypothèses, son coût et ses effets de bord.
Public visé¶
Toute personne qui veut comprendre l'architecture réelle d'un grand modèle récent. Aucun prérequis n'est supposé : la partie Fondations construit le cache clé-valeur, l'attention creuse, le Mixture-of-Experts et la quantification à partir de zéro.
Les personnes déjà familières de l'architecture Transformer peuvent commencer directement à l'Architecture.
Prérequis¶
- Aucun pour les fondations.
- Une lecture confortable de l'algèbre linéaire élémentaire aide pour l'architecture, sans être indispensable : chaque symbole est défini.
Temps de lecture et difficulté¶
8 parties · 33 chapitres · 5 à 7 h de lecture · niveau débutant → avancé
Parcours¶
Commencez par le parcours de lecture, qui propose quatre itinéraires selon le temps disponible, ou par le résumé exécutif si vous cherchez la conclusion en dix minutes.
Les parties¶
- Fondations — le cache clé-valeur, l'attention creuse, le Mixture-of-Experts, la quantification, et la lignée DeepSeek. Ce qu'il faut savoir avant de lire la suite.
- Architecture — CED, CSA2, indexeur hiérarchique, cache FP4, Single-Pass mHC, Engram, DSpark, voie visuelle.
- Déploiement — SWA Bounded Replay, gestion du cache persistant, fusion de noyaux, désagrégation encodeur/préremplissage/décodage.
- Entraînement — 45 T jetons multimodaux, optimiseurs Muon et Sinkhorn, post-entraînement agentique, effort de raisonnement contrôlable.
- Évaluations — modèle de base, modèle instruit, robustesse aux harnais d'agents, comparaison avec les concurrents, et ce que ces mesures ne disent pas.
- Utilisation — format de prompt, inférence locale, matériel, et les tarifs de l'API.
- Analyse critique — ce qui est vérifié, ce qui est revendiqué, ce qui reste ouvert.
- Annexes — glossaire, tableau des spécifications, sources.
Vérifications indépendantes réalisées pour ce rapport¶
Un script Python autonome reconstruit les chiffres annoncés
Depuis le seul config.json et les formats de quantification lus dans le
code d'inférence publié :
- les 551,93 G de paramètres du squelette — écart de 0,01 % avec les 552 G annoncés ;
- les 15,70 G activés au décodage et 7,61 G au préremplissage, dont le rapport de 2,06 est la conséquence directe du CED ;
- les 196,61 G de paramètres Engram — écart de 0,3 % ;
- les 890,0 octets par jeton de cache global, au dixième d'octet près, ce qui identifie au passage la composition exacte du cache : quatre couches sources et deux formats FP4 distincts ;
- les 389 120 octets par jeton que la figure officielle attribue à
« DeepSeek-V1 » sans nommer le modèle — retrouvés à l'octet près, ce qui
identifie ce modèle :
deepseek-llm-67b.
Le script et ses hypothèses sont donnés en entier dans Analyse critique · Ce qui est vérifié.
Les tarifs de l'API ont par ailleurs été revérifiés ligne à ligne sur la page officielle de DeepSeek — voir L'API et ses tarifs.
Ce que ce rapport ne vérifie pas
Aucun poids n'a été téléchargé et aucune évaluation n'a été relancée. Tous les chiffres de performance de ce rapport proviennent de DeepSeek et sont présentés comme tels. Aucune évaluation indépendante tierce n'était disponible au moment de la rédaction, le modèle ayant été publié le jour même.
Sources principales¶
- Rapport technique : DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression, DeepSeek-AI, 2026, 51 pages (PDF).
- Dépôt de poids :
deepseek-ai/DeepSeek-V4.1-Flash
—
config.json, implémentation d'inférence de référence, encodage de prompt, protocole d'évaluation. - Documentation d'API : grille tarifaire et annonce de sortie — les seules sources de prix, absents du rapport technique.
La liste complète est en annexes/sources.md.
Rapport créé le 10 septembre 2026. Dernière révision : 10 septembre 2026.