Prospective — et si on combinait les briques ?¶
Cette partie change de nature — lisez ceci d'abord
Tout ce qui précède dans ce rapport est de l'analyse : des faits publiés, des déductions arithmétiques, des hypothèses signalées comme telles.
Cette partie est de la conception. Elle ne décrit l'architecture d'aucun modèle existant, et surtout pas celle de Pokee-Isaac. C'est un exercice : prendre les briques publiques qui fonctionnent, les combiner, et vérifier par le calcul si l'assemblage tiendrait les contraintes que le rapport a établies.
Rien ici ne doit être cité comme une information sur Isaac.
Pourquoi cet exercice a un intérêt¶
Les parties précédentes ont établi trois choses :
- Une architecture atteignant 10 M de tokens sur un GPU unique doit avoir une mémoire majoritairement de taille fixe, une attention non globale et une activation creuse (Architecture · 04).
- Llama 4 Scout a échoué en résolvant la généralisation de longueur sans toucher au mur mémoire (Fondations · 05).
- Kimi K3 a résolu le mur mémoire avec KDA, mais plafonne à 1 M et paie très cher son cache de préfixe.
Aucun des deux ne fait tout. La question naturelle est donc : que donnerait la combinaison ?
L'intérêt n'est pas de deviner Isaac. Il est de savoir si les chiffres annoncés par Pokee sont atteignables avec des briques déjà publiées — et donc de mesurer ce qu'il resterait d'exceptionnel à son architecture.
Ce que vous allez apprendre¶
- Combiner KDA, iRoPE et un encodeur — la répartition du travail entre trois mémoires, et le budget complet chiffré.
- Une architecture d'encodeur — la proposition détaillée, y compris le correctif au problème de discrimination fine que ni Kimi ni Meta ne traitent.
- Ce que la recherche ouverte a déjà exploré — dix travaux publiés sur cette voie, avec ce que chacun démontre et où il s'arrête.
Le résultat en une ligne
L'assemblage tient : 332 Mo de mémoire d'inférence à 10 M de tokens, soit 1 558 fois moins que Llama 4 Scout, et il rentre sur une RTX 4090 avec 9 Go de marge — ce qui rendrait vraie la revendication que Architecture · 02 démontre fausse pour toute architecture à cache par token.