Sources¶
Sources primaires¶
Toutes consultées le 10 septembre 2026.
Rapport technique¶
DeepSeek-AI (2026). DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression. 51 pages. PDF
C'est la source de l'essentiel de ce rapport : architecture (section 2), infrastructure (3), pré-entraînement (4), post-entraînement (5), limites (6), annexes d'évaluation (B et C).
Dépôt de poids¶
deepseek-ai/DeepSeek-V4.1-Flash
| Fichier | Ce qu'il apporte à ce rapport |
|---|---|
config.json |
toutes les dimensions ; base de la reconstruction des paramètres |
inference/model.py |
les formats de quantification exacts du cache — indispensable pour retrouver les 890 octets |
inference/kernel.py |
tailles de blocs de quantification |
inference/README.md |
conversion des poids, exécution, auto-test |
encoding/README.md |
format de prompt, DSML, effort de raisonnement |
encoding/encoding.py |
implémentation de référence du format |
evaluation/README.md |
reproduction de DeepSWE v1.1 |
README.md |
carte de modèle, tableaux de benchmarks |
LICENSE |
MIT |
Modèles de comparaison¶
- deepseek-ai/deepseek-llm-67b-base
—
config.json, pour vérifier le facteur 437×. - deepseek-ai/DeepSeek-V4-Flash
—
config.json, pour reconstruire le facteur ~4×.
API Hugging Face¶
L'endpoint api/models/deepseek-ai/DeepSeek-V4.1-Flash?blobs=true fournit la
taille exacte des 48 fichiers safetensors : 510,30 Go.
Documentation d'API DeepSeek¶
- Grille tarifaire — prix creux et pleins, plafonds de sortie, limite de concurrence, matrice des fonctionnalités. Consultée et vérifiée le 10 septembre 2026.
- Annonce de sortie du 10 septembre 2026
— nom du modèle
deepseek-flash, calendrier de retrait de V4-Pro, partenaires, mention d'un V4.1-Pro à venir.
Ces deux pages sont la seule source de tarifs : le rapport technique n'en mentionne aucun. Elles alimentent le chapitre L'API et ses tarifs.
Travaux cités par le rapport technique¶
Ces références ne sont pas des sources de ce rapport : ce sont les travaux dont DeepSeek dit s'inspirer. Elles sont listées parce qu'elles éclairent l'origine des mécanismes.
Fondations directes de l'architecture¶
| Travail | Ce qu'il apporte |
|---|---|
| YoCo — Sun et al., You Only Cache Once, NeurIPS 2024 | l'idée que la moitié supérieure d'un Transformer peut partager le cache de la moitié inférieure — origine du CED |
| Engram — Cheng et al., Conditional Memory via Scalable Lookup, ACL 2026 | le module de mémoire conditionnelle |
| DSpark — Cheng et al., arXiv:2607.05147, 2026 | le décodage spéculatif à ordonnancement par confiance |
| mHC — Xie et al., 2026 | les flux résiduels multiples |
| DeepSeek-V4 — DeepSeek-AI, arXiv:2606.19348, 2026 | l'architecture dont V4.1-Flash est la simplification |
| DeepSeekMoE — Dai et al., arXiv:2401.06066, 2024 | experts partagés et fins |
Travaux sur la compression par couches, discutés puis dépassés¶
| Travail | Ce que DeepSeek en dit |
|---|---|
| IndexCache — Bai et al., arXiv:2603.12201 | réutilise les indices entre couches, mais n'économise aucun stockage de cache principal |
| YOIO — Sun et al., arXiv:2606.06467 | calcule le routage creux une fois pour tout le réseau, ce qui limite la performance |
| HySparse — Gao et al., arXiv:2602.03560 | laisse les couches creuses réutiliser le cache des couches denses, mais conserve des couches d'attention complète |
| Cross-Layer Attention — Brandon et al., NeurIPS 2024 | le partage de cache entre couches |
Formats numériques¶
- MXFP4 — Rouhani et al., Microscaling Data Formats for Deep Learning, 2023.
- NVFP4 — Alvarez et al., NVIDIA, 2025.
- QAT — Jacob et al., CVPR 2018.
Optimisation¶
- Muon — Jordan et al., 2024 ; Moonlight — Liu et al., arXiv:2502.16982.
- SinkGD — Scetbon et al., NeurIPS 2025.
- AdamW — Loshchilov et Hutter, ICLR 2019.
- Adafactor — Shazeer et Stern, ICML 2018 ; Adam-mini — Zhang et al., 2025.
Vision¶
- ViT — Dosovitskiy et al., ICLR 2021.
- SigLIP — Zhai et al., 2023.
- SmolVLM — Marafioti et al., arXiv:2504.05299, 2025.
Benchmarks principaux¶
Terminal-Bench (Merrill et al., arXiv:2601.11868 ; Marten et al., 2026), DeepSWE v1.1 (DataCurve), AutomationBench (Shepard et Salimans, arXiv:2604.18934), Agents' Last Exam (Sun et al., arXiv:2606.05405), HLE (Phan et al., arXiv:2501.14249), GPQA (Rein et al., arXiv:2311.12022), MathArena Apex (Dekoninck et al.), CyberGym (Wang et al.), SEC-Bench Pro (Lee et al., arXiv:2605.26548), ExploitGym (Wang et al., arXiv:2605.11086), ProgramBench (Yang et al.), NL2Repo-Bench (Ding et al., arXiv:2512.12730), FrontierSWE v2 (Kondra et al.), Chartography (Garre et al., arXiv:2608.10677), BabyVision (Chen et al., arXiv:2601.06521), ZeroBench (Roberts et al., arXiv:2502.09696).
Outils et harnais¶
- deepseek-recipe — github.com/deepseek-ai/deepseek-recipe
- DeepSeek Harness — github.com/deepseek-ai/deepseek-harness
- FlashMLA, DeepGEMM, TileKernels, DeepSelect — bibliothèques de noyaux publiées par DeepSeek.
- Pier — github.com/datacurve-ai/pier
- Claude Code, Codex, OpenCode, Pi, mini-SWE — harnais tiers utilisés dans les évaluations.
Évaluations indépendantes¶
Aucune sur DeepSeek-V4.1-Flash.
Le modèle a été publié le 10 septembre 2026, jour de rédaction de ce rapport. Aucune évaluation tierce, aucun test communautaire, aucune mesure de performance indépendante de ce modèle n'était disponible.
Un seul élément tiers est cité, et il porte sur la génération précédente :
- Artificial Analysis, mesures d'août 2026 sur DeepSeek-V4-Flash-0731 face à Kimi K3 — débit, temps au premier jeton, coût mixé par million de jetons. Reprises au chapitre Face aux concurrents, sans revérification à la source pour ce rapport.
Conséquence pour la lecture
Tous les chiffres de performance de ce rapport proviennent de DeepSeek. Aucun n'a été confirmé par un tiers sur ce modèle.
Cette page devra être révisée quand des évaluations indépendantes apparaîtront.
Vérifications réalisées pour ce rapport¶
Le script deepseek-v41-verification.py, reproduit en entier dans
Ce qui est vérifié, recalcule
depuis les sources primaires :
- les paramètres du squelette, activés et Engram ;
- les 890 octets de cache global par jeton ;
- le facteur 437× contre DeepSeek-V1 67B ;
- une reconstruction approchée du facteur contre DeepSeek-V4-Flash ;
- la taille du dépôt.
Il ne dépend d'aucune bibliothèque et s'exécute en une fraction de seconde.