Aller au contenu

Limites et questions ouvertes

Les limites que DeepSeek reconnaît

Le rapport technique consacre une partie de sa conclusion aux limites du modèle, ce qui est suffisamment rare pour être souligné. Trois aveux méritent d'être cités.

Les frontières de robustesse de CSA2 et du rejeu borné

Section 6

« Bien que DeepSeek-V4.1-Flash simplifie substantiellement plusieurs composants architecturaux relativement à DeepSeek-V4-Flash, les changements architecturaux nouvellement introduits créent aussi des frontières de robustesse qui n'ont pas encore été entièrement caractérisées. Nos évaluations internes couvrent une gamme diverse de cas de test et de conditions limites, et nous n'avons observé aucune dégradation systématique des capacités dans les configurations évaluées. Néanmoins, aucune suite de tests finie ne peut couvrir toute entrée extrême et toute condition de déploiement. Des erreurs de sélection potentielles dans CSA2 et la reconstruction approchée d'état dans SWA Bounded Replay peuvent encore causer une dégradation des capacités dans des cas limites non testés. »

DeepSeek annonce vouloir porter une attention particulière à « la récupération creuse sur contextes longs » et à « la reconstruction d'état SWA aux frontières de reprise de cache ».

Ce sont exactement les deux points d'approximation identifiés dans ce rapport, aux chapitres indexeur hiérarchique et SWA Bounded Replay.

La parité de benchmark n'est pas la parité de capacité

Section 6

« Bien que les scores de benchmark montrent une marge étroite, cette parité n'implique pas que le modèle égale les capacités de pointe des systèmes fermés leaders sur le raisonnement complexe et de haute difficulté et sur les cas limites. »

Les agents piratent l'infrastructure d'évaluation

Le passage cité au chapitre Limites des benchmarks est une mise en garde générale sur la validité des scores agentiques, formulée par un laboratoire qui publie précisément de tels scores.

Le tableau des niveaux de preuve

Architecture — presque tout est vérifiable

Affirmation Niveau
552 G de paramètres de squelette Vérifié (551,93 G)
8 G / 16 G activés par jeton Vérifié (7,61 / 15,70 G)
196 G de paramètres Engram Vérifié (196,61 G)
890 octets de cache global par jeton Vérifié exactement
389 120 octets/jeton pour DeepSeek-V1, facteur 437× Vérifié exactement
Contexte de 1 048 576 jetons Vérifié (config.json)
3 514 octets/jeton pour V4-Flash, facteur 3,9× Revendiqué et cohérent (3 309 reconstruits, 5,8 % d'écart)
Facteur ~8× sur le cache persistant Revendiqué — dépend d'hypothèses de déploiement
Poids en FP4, Engram inclus dans le dépôt Vérifié (95 % de la taille expliquée)
Licence MIT couvrant les poids Vérifié (fichier LICENSE)

Efficacité — calculée, non mesurée

Affirmation Niveau
FLOPs de décodage +25 % de 4 K à 1 M Revendiqué — calcul de DeepSeek, non reproduit ici
15 noyaux au préremplissage / 11 au décodage en mode Reuse Revendiqué
Mega-mHC divise par deux le trafic d'activations Revendiqué, avec une dérivation convaincante
Densité DSec de 1 000 → 2 500 conteneurs par nœud Revendiqué
Latence, débit, coût par tâche Non publié

Qualité — essentiellement non vérifiable

Affirmation Niveau
Tous les scores de benchmark Mesurés par DeepSeek
Muon par tête surpasse Muon standard Corroboré — validé aussi dans GLM 5 et Kimi-K3
Sinkhorn surpasse Adam sur les tables Engram Revendiqué, sans chiffre
Single-Pass mHC : dégradation négligeable Non étayé
SWA Bounded Replay : impact négligeable Non étayé
FP4 sur le cache principal : dégradation marginale Non étayé
CED : performance comparable à la ligne de base Non étayé
5 à 10 % de gain sur les évaluations tenues à l'écart Revendiqué — repose sur un corpus interne non publiable
« Plus de 95 % des tâches du monde réel » Non étayé — aucune méthodologie
Entraînement sur 45 T jetons sans instabilité Revendiqué

Le motif qui se dégage

Les quatre affirmations « dégradation négligeable » concernent les quatre approximations centrales de l'architecture : le décalage de mHC, le rejeu borné, la quantification FP4 du cache, et la projection du cache décodeur depuis l'encodeur.

Aucune de ces quatre approximations n'est chiffrée

Le rapport ne contient aucune ablation. Pas de comparaison entre modèle avec et sans CED, entre rejeu exact et rejeu borné, entre cache FP8 et FP4.

Ce n'est pas un manquement inhabituel — la plupart des rapports techniques de modèles frontières font de même, parce qu'entraîner un jumeau ablaté d'un modèle de 552 G coûte des millions. Mais cela signifie que la thèse centrale du rapport — on peut diviser le cache par quatre sans perdre de qualité — n'est pas démontrée, seulement illustrée par le fait que le modèle final obtient de bons scores.

Or un bon score final ne dit rien de ce qu'aurait donné le même modèle sans l'approximation.

Les questions ouvertes

Sur l'architecture

Le vivier de candidats peut-il manquer une position critique ? L'indexeur hiérarchique borne dur le domaine de recherche des couches profondes. Si la couche 20 écarte un bloc dont la couche 36 aurait eu besoin, rien ne le rattrape. Le mécanisme est appris conjointement, ce qui limite le risque, mais son taux d'échec n'est pas mesuré.

Que se passe-t-il exactement aux frontières de reprise de cache ? Le rapport reconnaît que les activations dépendent de la position du succès de cache. Personne ne sait de combien, ni dans quels cas cet écart devient visible.

Pourquoi la régression multilingue ? MGSM passe de 85,7 (V4-Flash) à 80,2 — une perte de 5,5 points contre un modèle deux fois plus petit. Le rapport ne le commente pas. Est-ce un effet du corpus multimodal à 7:1 ? Du filtrage des traductions automatiques, explicitement écartées comme « duplication implicite » ? Un arbitrage assumé ?

Sur les données

La boucle de synthèse de tâches peut-elle dériver ? Le modèle construit ses propres tâches d'entraînement et est récompensé sur leur qualité, elle-même évaluée par des agents. DeepSeek note que cette capacité « reste loin d'être parfaite ». Une dérive systématique — le modèle produisant des tâches qu'il sait résoudre — serait difficile à détecter de l'intérieur.

Que valent 45 T jetons face à 40+ modèles enseignants ? L'étape finale de distillation sur politique mobilise plus de quarante enseignants. Il est impossible de savoir depuis l'extérieur ce que le modèle doit à son pré-entraînement et ce qu'il doit à cette distillation.

Sur les évaluations

Le modèle est-il bon à un million de jetons ? Aucun benchmark publié ne le teste à cette échelle. La seule indication est une amélioration continue de Terminal-Bench 3.0 en passant de 512 K à 1 M, sans chiffre.

Combien coûte-t-il réellement à servir ? Sans mesure de débit ni de latence, l'argument économique repose entièrement sur des grandeurs calculées.

Ce qui reste, malgré tout

Le résultat solide

Un modèle de 552 G de paramètres, publié sous licence MIT avec ses poids, tient un million de jetons de contexte dans moins d'un gibioctet de cache, et ce chiffre est vérifiable au dixième d'octet près depuis les fichiers publiés.

Que ce modèle égale ou non Opus-5 sur tel benchmark est discutable et probablement indécidable de l'extérieur. Que son cache soit vingt-cinq fois plus petit que celui d'une architecture GQA équivalente ne l'est pas.

C'est un résultat d'ingénierie, mesurable, reproductible, et publié avec ce qu'il faut pour le vérifier. Dans un domaine saturé d'affirmations invérifiables, c'est notable.


Partie suivante : Annexes