Aller au contenu

Prospective — et si on combinait les briques ?

Cette partie change de nature — lisez ceci d'abord

Tout ce qui précède dans ce rapport est de l'analyse : des faits publiés, des déductions arithmétiques, des hypothèses signalées comme telles.

Cette partie est de la conception. Elle ne décrit l'architecture d'aucun modèle existant, et surtout pas celle de Pokee-Isaac. C'est un exercice : prendre les briques publiques qui fonctionnent, les combiner, et vérifier par le calcul si l'assemblage tiendrait les contraintes que le rapport a établies.

Rien ici ne doit être cité comme une information sur Isaac.


Pourquoi cet exercice a un intérêt

Les parties précédentes ont établi trois choses :

  1. Une architecture atteignant 10 M de tokens sur un GPU unique doit avoir une mémoire majoritairement de taille fixe, une attention non globale et une activation creuse (Architecture · 04).
  2. Llama 4 Scout a échoué en résolvant la généralisation de longueur sans toucher au mur mémoire (Fondations · 05).
  3. Kimi K3 a résolu le mur mémoire avec KDA, mais plafonne à 1 M et paie très cher son cache de préfixe.

Aucun des deux ne fait tout. La question naturelle est donc : que donnerait la combinaison ?

L'intérêt n'est pas de deviner Isaac. Il est de savoir si les chiffres annoncés par Pokee sont atteignables avec des briques déjà publiées — et donc de mesurer ce qu'il resterait d'exceptionnel à son architecture.

Ce que vous allez apprendre

  1. Combiner KDA, iRoPE et un encodeur — la répartition du travail entre trois mémoires, et le budget complet chiffré.
  2. Une architecture d'encodeur — la proposition détaillée, y compris le correctif au problème de discrimination fine que ni Kimi ni Meta ne traitent.
  3. Ce que la recherche ouverte a déjà exploré — dix travaux publiés sur cette voie, avec ce que chacun démontre et où il s'arrête.

Le résultat en une ligne

L'assemblage tient : 332 Mo de mémoire d'inférence à 10 M de tokens, soit 1 558 fois moins que Llama 4 Scout, et il rentre sur une RTX 4090 avec 9 Go de marge — ce qui rendrait vraie la revendication que Architecture · 02 démontre fausse pour toute architecture à cache par token.