Tableau des spécifications
Toutes les valeurs proviennent du config.json publié, sauf mention contraire.
Identité
| Élément |
Valeur |
| Nom |
DeepSeek-V4.1-Flash |
| Éditeur |
DeepSeek-AI |
| Publication |
10 septembre 2026 |
| Licence |
MIT, dépôt et poids |
| Dépôt |
deepseek-ai/DeepSeek-V4.1-Flash |
| Architecture déclarée |
DeepseekV41ForCausalLM |
| Type de tâche |
image-text-to-text |
| Taille du dépôt |
510,30 Go (475,25 Gio), 48 fichiers |
Squelette de langage
| Paramètre |
Valeur |
| Couches |
40 (20 encodeur + 20 décodeur) |
| Dimension cachée |
5 120 |
| Vocabulaire |
129 280 |
| Têtes d'attention |
64 |
| Dimension de tête |
512 |
| Dimension RoPE |
64 |
| Rang LoRA des requêtes |
1 280 |
| Rang LoRA de la sortie |
1 024 |
| Groupes de projection de sortie |
8 |
| Têtes clé-valeur |
1 (latent partagé) |
| Fenêtre glissante |
128 |
| Activation |
SiLU / SwiGLU, écrêtée à 10 |
| Epsilon RMSNorm |
\(10^{-20}\) |
| Type de calcul |
BF16 |
Mixture-of-Experts
| Paramètre |
Valeur |
| Experts routés |
384 |
| Experts partagés |
1 |
| Experts activés par jeton |
6 (+ 1 partagé) |
| Dimension interne d'un expert |
2 304 |
| Fonction de score |
sqrtsoftplus |
| Méthode Top-K |
noaux_tc |
| Normalisation des probabilités Top-K |
oui |
| Facteur d'échelle du routage |
1,5 |
| Vitesse de mise à jour du biais |
0,001 (texte et image séparément) |
| Perte d'équilibre au niveau séquence |
poids 0,0001 |
CSA2
| Paramètre |
Valeur |
| Couches sources de cache |
2, 8, 14, 20 |
| Couches sources d'indices |
2, 8, 14, 20, 24, 28, 32, 36 |
| Ratio de compression, encodeur |
2 |
| Ratio de compression, décodeur |
1 |
| Têtes d'indexeur |
32 |
| Dimension de tête d'indexeur |
128 |
| Top-K de l'attention |
512 |
| Couche source du vivier |
20 |
| Blocs candidats retenus |
2 048 |
| Taille d'un bloc candidat |
8 |
| Positions candidates |
16 384 |
| Base RoPE de la voie compressée |
160 000 |
| Base RoPE de la voie locale |
10 000 |
Contexte
| Paramètre |
Valeur |
| Fenêtre maximale |
1 048 576 jetons |
| Longueur d'origine |
65 536 |
| Méthode d'extension |
YaRN, facteur 16 |
beta_fast / beta_slow |
32 / 1 |
Cache clé-valeur
| Élément |
Valeur |
| Cache principal, format |
E2M1 + échelle E4M3 par bloc de 16 |
| Cache principal, coût |
4,5 bits/canal, 288 o/entrée |
| Clés d'indexeur, format |
MXFP4 (E2M1 + E8M0 par bloc de 32) |
| Clés d'indexeur, coût |
4,25 bits/canal, 68 o/entrée |
| Cache de fenêtre glissante |
FP8 |
| Cache global |
890 octets/jeton |
| Cache de fenêtre glissante total |
2,66 Mio par séquence |
| À 1 M de jetons |
0,87 Gio |
Extensions
| Élément |
Valeur |
| mHC, facteur d'expansion |
4 |
| mHC, itérations de Sinkhorn-Knopp |
20 |
| Engram, couches |
1 et 14 |
| Engram, lignes par module |
384 006 168 et 384 016 682 |
| Engram, dimension par tête |
256 |
| Engram, têtes de hachage |
8 |
| Engram, ordres de n-grammes |
2, 3, 4 |
| Engram, vocabulaire compressé |
99 092 |
| Engram, paramètres |
196,61 G |
| DSpark, couches cibles |
37, 38, 39 |
| DSpark, taille de bloc |
5 |
| DSpark, rang de la tête de Markov |
256 |
| DSpark, experts routés |
128, dont 3 activés |
| Couches de prédiction du jeton suivant |
3 |
Vision
| Paramètre |
Valeur |
| Couches |
32 |
| Dimension cachée |
1 024 |
| Têtes |
16 |
| Dimension intermédiaire |
2 816 |
| Taille de patch |
14 |
| Facteur de sous-échantillonnage |
3 (pixel-unshuffle 3×3) |
| Jetons image maximum |
1 024 |
| Pixels minimum |
295 936 |
| Résolution maximale effective |
≈ 1 344 × 1 344 |
| Projecteur |
MLP 2 couches vers 5 120 |
Quantification des poids
| Élément |
Valeur |
| Méthode |
FP8 |
| Schéma d'activation |
dynamique |
| Bloc de poids |
32 × 32 |
| Format d'échelle |
UE8M0 |
| Type des experts |
FP4 |
Paramètres
| Élément |
Annoncé |
Recalculé |
| Squelette |
552 G |
551,93 G |
| Activés, préremplissage |
8 G |
7,61 G |
| Activés, décodage |
16 G |
15,70 G |
| Engram |
196 G |
196,61 G |
Entraînement
| Élément |
Valeur |
| Jetons de pré-entraînement |
45 T, multimodaux |
| Rapport texte/multimodal |
7:1 |
| Taille de lot |
100,6 M jetons, constante |
| Taux d'apprentissage maximal |
\(2{,}6 \times 10^{-4}\) |
| Taux d'apprentissage final |
\(2{,}6 \times 10^{-5}\) |
| Échauffement |
2 000 pas |
| Longueur de séquence initiale |
64 K |
| Extension à 1 M |
à 34 T jetons |
| Optimiseurs |
Muon, Muon par tête, Sinkhorn, AdamW |
| Muon : momentum / weight decay / RMS |
0,95 / 0,1 / 0,18 |
| AdamW : \(\beta_1\), \(\beta_2\), \(\varepsilon\), wd |
0,9 · 0,95 · \(10^{-20}\) · 0,1 |
| Sinkhorn : \(K\), \(\tau\), \(\varepsilon\), \(\gamma\) |
11 · \(10^{-3}\) · \(10^{-20}\) · 0,18 |
| Multiplicateur de LR pour Engram |
×5 |
| Vision : pré-entraînement contrastif |
47 G paires, 224×224, SigLIP |
| Vision : affinage autorégressif |
236 G jetons, 544×544 à 1344×1344 |
Inférence recommandée
| Paramètre |
Valeur |
temperature |
1,0 |
top_p |
0,95 ou 1,0 |
max_tokens |
≥ 256 K |
| Effort par défaut |
75 (high) |
| Paliers d'API |
low 50, high 75, max 100 |
| Jetons spéciaux |
BOS 0, EOS 1, PAD 2, image 129 264 |