Limites et questions ouvertes¶
Les limites que DeepSeek reconnaît¶
Le rapport technique consacre une partie de sa conclusion aux limites du modèle, ce qui est suffisamment rare pour être souligné. Trois aveux méritent d'être cités.
Les frontières de robustesse de CSA2 et du rejeu borné¶
Section 6
« Bien que DeepSeek-V4.1-Flash simplifie substantiellement plusieurs composants architecturaux relativement à DeepSeek-V4-Flash, les changements architecturaux nouvellement introduits créent aussi des frontières de robustesse qui n'ont pas encore été entièrement caractérisées. Nos évaluations internes couvrent une gamme diverse de cas de test et de conditions limites, et nous n'avons observé aucune dégradation systématique des capacités dans les configurations évaluées. Néanmoins, aucune suite de tests finie ne peut couvrir toute entrée extrême et toute condition de déploiement. Des erreurs de sélection potentielles dans CSA2 et la reconstruction approchée d'état dans SWA Bounded Replay peuvent encore causer une dégradation des capacités dans des cas limites non testés. »
DeepSeek annonce vouloir porter une attention particulière à « la récupération creuse sur contextes longs » et à « la reconstruction d'état SWA aux frontières de reprise de cache ».
Ce sont exactement les deux points d'approximation identifiés dans ce rapport, aux chapitres indexeur hiérarchique et SWA Bounded Replay.
La parité de benchmark n'est pas la parité de capacité¶
Section 6
« Bien que les scores de benchmark montrent une marge étroite, cette parité n'implique pas que le modèle égale les capacités de pointe des systèmes fermés leaders sur le raisonnement complexe et de haute difficulté et sur les cas limites. »
Les agents piratent l'infrastructure d'évaluation¶
Le passage cité au chapitre Limites des benchmarks est une mise en garde générale sur la validité des scores agentiques, formulée par un laboratoire qui publie précisément de tels scores.
Le tableau des niveaux de preuve¶
Architecture — presque tout est vérifiable¶
| Affirmation | Niveau |
|---|---|
| 552 G de paramètres de squelette | Vérifié (551,93 G) |
| 8 G / 16 G activés par jeton | Vérifié (7,61 / 15,70 G) |
| 196 G de paramètres Engram | Vérifié (196,61 G) |
| 890 octets de cache global par jeton | Vérifié exactement |
| 389 120 octets/jeton pour DeepSeek-V1, facteur 437× | Vérifié exactement |
| Contexte de 1 048 576 jetons | Vérifié (config.json) |
| 3 514 octets/jeton pour V4-Flash, facteur 3,9× | Revendiqué et cohérent (3 309 reconstruits, 5,8 % d'écart) |
| Facteur ~8× sur le cache persistant | Revendiqué — dépend d'hypothèses de déploiement |
| Poids en FP4, Engram inclus dans le dépôt | Vérifié (95 % de la taille expliquée) |
| Licence MIT couvrant les poids | Vérifié (fichier LICENSE) |
Efficacité — calculée, non mesurée¶
| Affirmation | Niveau |
|---|---|
| FLOPs de décodage +25 % de 4 K à 1 M | Revendiqué — calcul de DeepSeek, non reproduit ici |
| 15 noyaux au préremplissage / 11 au décodage en mode Reuse | Revendiqué |
| Mega-mHC divise par deux le trafic d'activations | Revendiqué, avec une dérivation convaincante |
| Densité DSec de 1 000 → 2 500 conteneurs par nœud | Revendiqué |
| Latence, débit, coût par tâche | Non publié |
Qualité — essentiellement non vérifiable¶
| Affirmation | Niveau |
|---|---|
| Tous les scores de benchmark | Mesurés par DeepSeek |
| Muon par tête surpasse Muon standard | Corroboré — validé aussi dans GLM 5 et Kimi-K3 |
| Sinkhorn surpasse Adam sur les tables Engram | Revendiqué, sans chiffre |
| Single-Pass mHC : dégradation négligeable | Non étayé |
| SWA Bounded Replay : impact négligeable | Non étayé |
| FP4 sur le cache principal : dégradation marginale | Non étayé |
| CED : performance comparable à la ligne de base | Non étayé |
| 5 à 10 % de gain sur les évaluations tenues à l'écart | Revendiqué — repose sur un corpus interne non publiable |
| « Plus de 95 % des tâches du monde réel » | Non étayé — aucune méthodologie |
| Entraînement sur 45 T jetons sans instabilité | Revendiqué |
Le motif qui se dégage¶
Les quatre affirmations « dégradation négligeable » concernent les quatre approximations centrales de l'architecture : le décalage de mHC, le rejeu borné, la quantification FP4 du cache, et la projection du cache décodeur depuis l'encodeur.
Aucune de ces quatre approximations n'est chiffrée
Le rapport ne contient aucune ablation. Pas de comparaison entre modèle avec et sans CED, entre rejeu exact et rejeu borné, entre cache FP8 et FP4.
Ce n'est pas un manquement inhabituel — la plupart des rapports techniques de modèles frontières font de même, parce qu'entraîner un jumeau ablaté d'un modèle de 552 G coûte des millions. Mais cela signifie que la thèse centrale du rapport — on peut diviser le cache par quatre sans perdre de qualité — n'est pas démontrée, seulement illustrée par le fait que le modèle final obtient de bons scores.
Or un bon score final ne dit rien de ce qu'aurait donné le même modèle sans l'approximation.
Les questions ouvertes¶
Sur l'architecture¶
Le vivier de candidats peut-il manquer une position critique ? L'indexeur hiérarchique borne dur le domaine de recherche des couches profondes. Si la couche 20 écarte un bloc dont la couche 36 aurait eu besoin, rien ne le rattrape. Le mécanisme est appris conjointement, ce qui limite le risque, mais son taux d'échec n'est pas mesuré.
Que se passe-t-il exactement aux frontières de reprise de cache ? Le rapport reconnaît que les activations dépendent de la position du succès de cache. Personne ne sait de combien, ni dans quels cas cet écart devient visible.
Pourquoi la régression multilingue ? MGSM passe de 85,7 (V4-Flash) à 80,2 — une perte de 5,5 points contre un modèle deux fois plus petit. Le rapport ne le commente pas. Est-ce un effet du corpus multimodal à 7:1 ? Du filtrage des traductions automatiques, explicitement écartées comme « duplication implicite » ? Un arbitrage assumé ?
Sur les données¶
La boucle de synthèse de tâches peut-elle dériver ? Le modèle construit ses propres tâches d'entraînement et est récompensé sur leur qualité, elle-même évaluée par des agents. DeepSeek note que cette capacité « reste loin d'être parfaite ». Une dérive systématique — le modèle produisant des tâches qu'il sait résoudre — serait difficile à détecter de l'intérieur.
Que valent 45 T jetons face à 40+ modèles enseignants ? L'étape finale de distillation sur politique mobilise plus de quarante enseignants. Il est impossible de savoir depuis l'extérieur ce que le modèle doit à son pré-entraînement et ce qu'il doit à cette distillation.
Sur les évaluations¶
Le modèle est-il bon à un million de jetons ? Aucun benchmark publié ne le teste à cette échelle. La seule indication est une amélioration continue de Terminal-Bench 3.0 en passant de 512 K à 1 M, sans chiffre.
Combien coûte-t-il réellement à servir ? Sans mesure de débit ni de latence, l'argument économique repose entièrement sur des grandeurs calculées.
Ce qui reste, malgré tout¶
Le résultat solide
Un modèle de 552 G de paramètres, publié sous licence MIT avec ses poids, tient un million de jetons de contexte dans moins d'un gibioctet de cache, et ce chiffre est vérifiable au dixième d'octet près depuis les fichiers publiés.
Que ce modèle égale ou non Opus-5 sur tel benchmark est discutable et probablement indécidable de l'extérieur. Que son cache soit vingt-cinq fois plus petit que celui d'une architecture GQA équivalente ne l'est pas.
C'est un résultat d'ingénierie, mesurable, reproductible, et publié avec ce qu'il faut pour le vérifier. Dans un domaine saturé d'affirmations invérifiables, c'est notable.
Partie suivante : Annexes