Aller au contenu

Sources

Sources primaires

Toutes consultées le 10 septembre 2026.

Rapport technique

DeepSeek-AI (2026). DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression. 51 pages. PDF

C'est la source de l'essentiel de ce rapport : architecture (section 2), infrastructure (3), pré-entraînement (4), post-entraînement (5), limites (6), annexes d'évaluation (B et C).

Dépôt de poids

deepseek-ai/DeepSeek-V4.1-Flash

Fichier Ce qu'il apporte à ce rapport
config.json toutes les dimensions ; base de la reconstruction des paramètres
inference/model.py les formats de quantification exacts du cache — indispensable pour retrouver les 890 octets
inference/kernel.py tailles de blocs de quantification
inference/README.md conversion des poids, exécution, auto-test
encoding/README.md format de prompt, DSML, effort de raisonnement
encoding/encoding.py implémentation de référence du format
evaluation/README.md reproduction de DeepSWE v1.1
README.md carte de modèle, tableaux de benchmarks
LICENSE MIT

Modèles de comparaison

API Hugging Face

L'endpoint api/models/deepseek-ai/DeepSeek-V4.1-Flash?blobs=true fournit la taille exacte des 48 fichiers safetensors : 510,30 Go.

Documentation d'API DeepSeek

  • Grille tarifaire — prix creux et pleins, plafonds de sortie, limite de concurrence, matrice des fonctionnalités. Consultée et vérifiée le 10 septembre 2026.
  • Annonce de sortie du 10 septembre 2026 — nom du modèle deepseek-flash, calendrier de retrait de V4-Pro, partenaires, mention d'un V4.1-Pro à venir.

Ces deux pages sont la seule source de tarifs : le rapport technique n'en mentionne aucun. Elles alimentent le chapitre L'API et ses tarifs.

Travaux cités par le rapport technique

Ces références ne sont pas des sources de ce rapport : ce sont les travaux dont DeepSeek dit s'inspirer. Elles sont listées parce qu'elles éclairent l'origine des mécanismes.

Fondations directes de l'architecture

Travail Ce qu'il apporte
YoCo — Sun et al., You Only Cache Once, NeurIPS 2024 l'idée que la moitié supérieure d'un Transformer peut partager le cache de la moitié inférieure — origine du CED
Engram — Cheng et al., Conditional Memory via Scalable Lookup, ACL 2026 le module de mémoire conditionnelle
DSpark — Cheng et al., arXiv:2607.05147, 2026 le décodage spéculatif à ordonnancement par confiance
mHC — Xie et al., 2026 les flux résiduels multiples
DeepSeek-V4 — DeepSeek-AI, arXiv:2606.19348, 2026 l'architecture dont V4.1-Flash est la simplification
DeepSeekMoE — Dai et al., arXiv:2401.06066, 2024 experts partagés et fins

Travaux sur la compression par couches, discutés puis dépassés

Travail Ce que DeepSeek en dit
IndexCache — Bai et al., arXiv:2603.12201 réutilise les indices entre couches, mais n'économise aucun stockage de cache principal
YOIO — Sun et al., arXiv:2606.06467 calcule le routage creux une fois pour tout le réseau, ce qui limite la performance
HySparse — Gao et al., arXiv:2602.03560 laisse les couches creuses réutiliser le cache des couches denses, mais conserve des couches d'attention complète
Cross-Layer Attention — Brandon et al., NeurIPS 2024 le partage de cache entre couches

Formats numériques

  • MXFP4 — Rouhani et al., Microscaling Data Formats for Deep Learning, 2023.
  • NVFP4 — Alvarez et al., NVIDIA, 2025.
  • QAT — Jacob et al., CVPR 2018.

Optimisation

  • Muon — Jordan et al., 2024 ; Moonlight — Liu et al., arXiv:2502.16982.
  • SinkGD — Scetbon et al., NeurIPS 2025.
  • AdamW — Loshchilov et Hutter, ICLR 2019.
  • Adafactor — Shazeer et Stern, ICML 2018 ; Adam-mini — Zhang et al., 2025.

Vision

  • ViT — Dosovitskiy et al., ICLR 2021.
  • SigLIP — Zhai et al., 2023.
  • SmolVLM — Marafioti et al., arXiv:2504.05299, 2025.

Benchmarks principaux

Terminal-Bench (Merrill et al., arXiv:2601.11868 ; Marten et al., 2026), DeepSWE v1.1 (DataCurve), AutomationBench (Shepard et Salimans, arXiv:2604.18934), Agents' Last Exam (Sun et al., arXiv:2606.05405), HLE (Phan et al., arXiv:2501.14249), GPQA (Rein et al., arXiv:2311.12022), MathArena Apex (Dekoninck et al.), CyberGym (Wang et al.), SEC-Bench Pro (Lee et al., arXiv:2605.26548), ExploitGym (Wang et al., arXiv:2605.11086), ProgramBench (Yang et al.), NL2Repo-Bench (Ding et al., arXiv:2512.12730), FrontierSWE v2 (Kondra et al.), Chartography (Garre et al., arXiv:2608.10677), BabyVision (Chen et al., arXiv:2601.06521), ZeroBench (Roberts et al., arXiv:2502.09696).

Outils et harnais

Évaluations indépendantes

Aucune sur DeepSeek-V4.1-Flash.

Le modèle a été publié le 10 septembre 2026, jour de rédaction de ce rapport. Aucune évaluation tierce, aucun test communautaire, aucune mesure de performance indépendante de ce modèle n'était disponible.

Un seul élément tiers est cité, et il porte sur la génération précédente :

  • Artificial Analysis, mesures d'août 2026 sur DeepSeek-V4-Flash-0731 face à Kimi K3 — débit, temps au premier jeton, coût mixé par million de jetons. Reprises au chapitre Face aux concurrents, sans revérification à la source pour ce rapport.

Conséquence pour la lecture

Tous les chiffres de performance de ce rapport proviennent de DeepSeek. Aucun n'a été confirmé par un tiers sur ce modèle.

Cette page devra être révisée quand des évaluations indépendantes apparaîtront.

Vérifications réalisées pour ce rapport

Le script deepseek-v41-verification.py, reproduit en entier dans Ce qui est vérifié, recalcule depuis les sources primaires :

  • les paramètres du squelette, activés et Engram ;
  • les 890 octets de cache global par jeton ;
  • le facteur 437× contre DeepSeek-V1 67B ;
  • une reconstruction approchée du facteur contre DeepSeek-V4-Flash ;
  • la taille du dépôt.

Il ne dépend d'aucune bibliothèque et s'exécute en une fraction de seconde.