Aller au contenu

Tableau des spécifications

Toutes les valeurs proviennent du config.json publié, sauf mention contraire.

Identité

Élément Valeur
Nom DeepSeek-V4.1-Flash
Éditeur DeepSeek-AI
Publication 10 septembre 2026
Licence MIT, dépôt et poids
Dépôt deepseek-ai/DeepSeek-V4.1-Flash
Architecture déclarée DeepseekV41ForCausalLM
Type de tâche image-text-to-text
Taille du dépôt 510,30 Go (475,25 Gio), 48 fichiers

Squelette de langage

Paramètre Valeur
Couches 40 (20 encodeur + 20 décodeur)
Dimension cachée 5 120
Vocabulaire 129 280
Têtes d'attention 64
Dimension de tête 512
Dimension RoPE 64
Rang LoRA des requêtes 1 280
Rang LoRA de la sortie 1 024
Groupes de projection de sortie 8
Têtes clé-valeur 1 (latent partagé)
Fenêtre glissante 128
Activation SiLU / SwiGLU, écrêtée à 10
Epsilon RMSNorm \(10^{-20}\)
Type de calcul BF16

Mixture-of-Experts

Paramètre Valeur
Experts routés 384
Experts partagés 1
Experts activés par jeton 6 (+ 1 partagé)
Dimension interne d'un expert 2 304
Fonction de score sqrtsoftplus
Méthode Top-K noaux_tc
Normalisation des probabilités Top-K oui
Facteur d'échelle du routage 1,5
Vitesse de mise à jour du biais 0,001 (texte et image séparément)
Perte d'équilibre au niveau séquence poids 0,0001

CSA2

Paramètre Valeur
Couches sources de cache 2, 8, 14, 20
Couches sources d'indices 2, 8, 14, 20, 24, 28, 32, 36
Ratio de compression, encodeur 2
Ratio de compression, décodeur 1
Têtes d'indexeur 32
Dimension de tête d'indexeur 128
Top-K de l'attention 512
Couche source du vivier 20
Blocs candidats retenus 2 048
Taille d'un bloc candidat 8
Positions candidates 16 384
Base RoPE de la voie compressée 160 000
Base RoPE de la voie locale 10 000

Contexte

Paramètre Valeur
Fenêtre maximale 1 048 576 jetons
Longueur d'origine 65 536
Méthode d'extension YaRN, facteur 16
beta_fast / beta_slow 32 / 1

Cache clé-valeur

Élément Valeur
Cache principal, format E2M1 + échelle E4M3 par bloc de 16
Cache principal, coût 4,5 bits/canal, 288 o/entrée
Clés d'indexeur, format MXFP4 (E2M1 + E8M0 par bloc de 32)
Clés d'indexeur, coût 4,25 bits/canal, 68 o/entrée
Cache de fenêtre glissante FP8
Cache global 890 octets/jeton
Cache de fenêtre glissante total 2,66 Mio par séquence
À 1 M de jetons 0,87 Gio

Extensions

Élément Valeur
mHC, facteur d'expansion 4
mHC, itérations de Sinkhorn-Knopp 20
Engram, couches 1 et 14
Engram, lignes par module 384 006 168 et 384 016 682
Engram, dimension par tête 256
Engram, têtes de hachage 8
Engram, ordres de n-grammes 2, 3, 4
Engram, vocabulaire compressé 99 092
Engram, paramètres 196,61 G
DSpark, couches cibles 37, 38, 39
DSpark, taille de bloc 5
DSpark, rang de la tête de Markov 256
DSpark, experts routés 128, dont 3 activés
Couches de prédiction du jeton suivant 3

Vision

Paramètre Valeur
Couches 32
Dimension cachée 1 024
Têtes 16
Dimension intermédiaire 2 816
Taille de patch 14
Facteur de sous-échantillonnage 3 (pixel-unshuffle 3×3)
Jetons image maximum 1 024
Pixels minimum 295 936
Résolution maximale effective ≈ 1 344 × 1 344
Projecteur MLP 2 couches vers 5 120

Quantification des poids

Élément Valeur
Méthode FP8
Schéma d'activation dynamique
Bloc de poids 32 × 32
Format d'échelle UE8M0
Type des experts FP4

Paramètres

Élément Annoncé Recalculé
Squelette 552 G 551,93 G
Activés, préremplissage 8 G 7,61 G
Activés, décodage 16 G 15,70 G
Engram 196 G 196,61 G

Entraînement

Élément Valeur
Jetons de pré-entraînement 45 T, multimodaux
Rapport texte/multimodal 7:1
Taille de lot 100,6 M jetons, constante
Taux d'apprentissage maximal \(2{,}6 \times 10^{-4}\)
Taux d'apprentissage final \(2{,}6 \times 10^{-5}\)
Échauffement 2 000 pas
Longueur de séquence initiale 64 K
Extension à 1 M à 34 T jetons
Optimiseurs Muon, Muon par tête, Sinkhorn, AdamW
Muon : momentum / weight decay / RMS 0,95 / 0,1 / 0,18
AdamW : \(\beta_1\), \(\beta_2\), \(\varepsilon\), wd 0,9 · 0,95 · \(10^{-20}\) · 0,1
Sinkhorn : \(K\), \(\tau\), \(\varepsilon\), \(\gamma\) 11 · \(10^{-3}\) · \(10^{-20}\) · 0,18
Multiplicateur de LR pour Engram ×5
Vision : pré-entraînement contrastif 47 G paires, 224×224, SigLIP
Vision : affinage autorégressif 236 G jetons, 544×544 à 1344×1344

Inférence recommandée

Paramètre Valeur
temperature 1,0
top_p 0,95 ou 1,0
max_tokens ≥ 256 K
Effort par défaut 75 (high)
Paliers d'API low 50, high 75, max 100
Jetons spéciaux BOS 0, EOS 1, PAD 2, image 129 264