Ce que la recherche ouverte a déjà exploré¶
La voie « encodeur + mémoire compressée » n'a rien d'exotique : elle est documentée depuis 2023, avec code ouvert. Ce chapitre recense les travaux publiés, ce que chacun démontre, et où il s'arrête.
Toutes les références ci-dessous ont été vérifiées ; les identifiants arXiv sont exacts.
Encodeur parallèle et attention croisée — la voie directe¶
CEPE¶
Long-Context Language Modeling with Parallel Context Encoding
· Howard Yen, Tianyu Gao, Danqi Chen (Princeton) · ACL 2024 · arXiv:2402.16617
· code
Un petit encodeur traite l'entrée longue bloc par bloc, et un décodeur gelé y accède par attention croisée.
| Résultat | Valeur |
|---|---|
| Longueur d'entraînement | 8 K de tokens |
| Contexte atteint sur Llama-2 | 128 K |
| Débit | ×10 |
| Mémoire | 1/6 |
Pourquoi c'est le papier le plus proche de la proposition
CEPE établit les deux propriétés structurelles recherchées : les blocs sont indépendants (donc parallélisables et cacheables), et le décodeur de base peut rester gelé — on n'entraîne que l'encodeur et les couches croisées.
C'est aussi ce qui rendrait une telle architecture abordable pour une jeune pousse : pas de pré-entraînement, exactement comme ce que Pokee décrit avec sa base Qwen3.6-27B partiellement affinée.
Où il s'arrête : 128 K de tokens. Rien ne démontre que la recette tienne à 10 M.
YOCO¶
You Only Cache Once: Decoder-Decoder Architectures for Language Models
· Microsoft Research et Tsinghua · NeurIPS 2024 · arXiv:2405.05254
Un self-decoder produit un seul cache clé-valeur global, qu'un cross-decoder consulte par attention croisée. Le modèle se comporte comme un décodeur classique mais ne met en cache qu'une fois.
| Résultat | Valeur |
|---|---|
| Contexte | 1 M, rappel quasi parfait en aiguille dans une botte de foin |
| Mémoire, latence de préfill, débit | améliorés « de plusieurs ordres de grandeur » |
| Propriété notable | le préfill peut sortir tôt sans changer la sortie |
Où il s'arrête : 1 M, et l'évaluation de rappel repose sur l'aiguille dans une botte de foin — le test que Fondations · 04 juge trop facile.
Unlimiformer¶
On The Adaptation of Unlimiformer for Decoder-Only Transformers
· d'après Bertsch et al., NeurIPS 2024 · arXiv:2410.01637
L'attention croisée est déportée sur un index de plus proches voisins. La mémoire n'est plus lue en entier : elle est interrogée.
Où il s'arrête : l'index kNN n'est pas différentiable, ce qui limite l'entraînement de bout en bout — précisément ce que NSA corrigera.
Compression en tokens de mémoire¶
Gist Tokens¶
Learning to Compress Prompts with Gist Tokens
· Jesse Mu, Xiang Lisa Li, Noah Goodman (Stanford) · NeurIPS 2023 ·
arXiv:2304.08467
Le résultat fondateur, et d'une élégance rare : la compression s'obtient en modifiant seulement le masque d'attention, sans architecture nouvelle ni surcoût d'entraînement.
Jusqu'à 26× de compression, −40 % de FLOPs, perte de qualité minime.
AutoCompressor¶
Adapting Language Models to Compress Contexts
· Alexis Chevalier, Alexander Wettig, Anirudh Ajith, Danqi Chen (Princeton) ·
EMNLP 2023 · arXiv:2305.14788 ·
code
Des vecteurs de résumé produits récursivement, segment par segment, et réinjectés comme invites douces. Séquences allant jusqu'à 30 720 tokens.
Apport principal pour notre sujet : les vecteurs peuvent être précalculés pour un corpus entier — c'est l'argument du cache.
ICAE¶
In-context Autoencoder for Context Compression in a Large Language Model
· Tao Ge et al. · arXiv:2307.06945 · code
Formalise le schéma encodeur–décodeur : pré-entraînement par autoencodage et modélisation du langage, puis affinage sur instructions. 4× de compression pour environ 1 % de paramètres supplémentaires.
C'est de ce travail que vient l'objectif de reconstruction proposé au chapitre précédent.
Activation Beacon¶
Long Context Compression with Activation Beacon
· ICLR 2025 · arXiv:2401.03462
Des jetons « balises » entrelacés avec les jetons bruts, ce qui donne à chaque balise une portée d'attention différenciée et donc une compression à grain fin. Compression et génération dans une seule passe avant, sans second modèle.
Mémoire compressive et sélection¶
Infini-attention¶
Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention
· Google · 2024 · arXiv:2404.07143
Place une mémoire compressive et l'attention locale dans le même bloc, pour une mémoire et un calcul bornés. Plus de 100× de taux de compression par rapport aux Memorizing Transformers.
C'est le cousin conceptuel de KDA : un état de taille fixe, mais intégré à une couche d'attention plutôt qu'en remplacement.
NSA¶
Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention
· DeepSeek · ACL 2025 · arXiv:2502.11089
Trois voies combinées, exactement la structure proposée au chapitre précédent :
- compression de blocs (grain grossier) ;
- sélection des blocs pertinents (grain fin) ;
- fenêtre glissante (précision locale).
Paramètres publiés : blocs de compression de 32 avec pas de 16, blocs sélectionnés de 64, 16 blocs retenus, fenêtre de 512.
L'apport décisif de NSA
NSA est nativement entraînable — la sélection est différentiable, contrairement à un index kNN. C'est ce qui permet d'entraîner le modèle et son mécanisme de récupération ensemble, au lieu de greffer une recherche documentaire sur un modèle figé.
C'est cette propriété qui rend le point 5 de la proposition réaliste.
Cartridges¶
Cartridges: Lightweight and general-purpose long context representations via self-study
· Sabri Eyuboglu et al. (Stanford) · 2025 · arXiv:2506.06266 ·
code
Le renversement le plus intéressant : au lieu de calculer une mémoire à l'inférence, on l'entraîne hors ligne. Un corpus est compressé en un cache clé-valeur de taille fixe, entraînable, qui s'intègre directement dans les serveurs d'inférence existants.
| Résultat | Valeur |
|---|---|
| Mémoire | 38,6× moins qu'un apprentissage en contexte |
| Débit | 26,4× plus |
| Compression | 10 à 100× |
Pertinence pour un usage d'entreprise — celui que vise précisément Isaac : si le corpus est stable (base de code, corpus juridique, documentation), le compresser une fois pour toutes est bien plus efficace que le réencoder à chaque requête.
Synthèse¶
| Travail | Encodeur séparé | Cacheable | Sélection | Entraînable de bout en bout | Contexte atteint |
|---|---|---|---|---|---|
| Gist Tokens | non | oui | non | oui | invite |
| AutoCompressor | non | oui | non | oui | 30 K |
| ICAE | oui | oui | non | oui | — |
| Activation Beacon | non | oui | non | oui | 100 K+ |
| Infini-attention | non | non | non | oui | « infini » |
| CEPE | oui | oui | non | oui | 128 K |
| YOCO | partiel | oui | non | oui | 1 M |
| Unlimiformer | oui | oui | oui | non | — |
| NSA | non | oui | oui | oui | 64 K |
| Cartridges | hors ligne | oui | non | oui | corpus |
La case vide
Aucune ligne ne combine tout, et aucune ne va à 10 M.
Les briques existent séparément : CEPE pour l'encodeur parallèle, NSA pour la sélection différentiable, Cartridges pour la mémoire apprise. Personne ne les a assemblées publiquement, et personne n'a publié à cette échelle.
C'est très exactement l'espace où Pokee revendique ses cinq brevets. Si Isaac fonctionne comme annoncé, son apport se situe dans cet assemblage — pas dans l'invention d'une brique nouvelle.
Les trois papiers à lire en premier
- CEPE — l'encodeur parallèle, la structure de base.
- NSA — la sélection, qui débloque tout le dimensionnement.
- Cartridges — la mémoire apprise plutôt que calculée.