Aller au contenu

Ce que la recherche ouverte a déjà exploré

La voie « encodeur + mémoire compressée » n'a rien d'exotique : elle est documentée depuis 2023, avec code ouvert. Ce chapitre recense les travaux publiés, ce que chacun démontre, et où il s'arrête.

Toutes les références ci-dessous ont été vérifiées ; les identifiants arXiv sont exacts.


Encodeur parallèle et attention croisée — la voie directe

CEPE

Long-Context Language Modeling with Parallel Context Encoding · Howard Yen, Tianyu Gao, Danqi Chen (Princeton) · ACL 2024 · arXiv:2402.16617 · code

Un petit encodeur traite l'entrée longue bloc par bloc, et un décodeur gelé y accède par attention croisée.

Résultat Valeur
Longueur d'entraînement 8 K de tokens
Contexte atteint sur Llama-2 128 K
Débit ×10
Mémoire 1/6

Pourquoi c'est le papier le plus proche de la proposition

CEPE établit les deux propriétés structurelles recherchées : les blocs sont indépendants (donc parallélisables et cacheables), et le décodeur de base peut rester gelé — on n'entraîne que l'encodeur et les couches croisées.

C'est aussi ce qui rendrait une telle architecture abordable pour une jeune pousse : pas de pré-entraînement, exactement comme ce que Pokee décrit avec sa base Qwen3.6-27B partiellement affinée.

Où il s'arrête : 128 K de tokens. Rien ne démontre que la recette tienne à 10 M.

YOCO

You Only Cache Once: Decoder-Decoder Architectures for Language Models · Microsoft Research et Tsinghua · NeurIPS 2024 · arXiv:2405.05254

Un self-decoder produit un seul cache clé-valeur global, qu'un cross-decoder consulte par attention croisée. Le modèle se comporte comme un décodeur classique mais ne met en cache qu'une fois.

Résultat Valeur
Contexte 1 M, rappel quasi parfait en aiguille dans une botte de foin
Mémoire, latence de préfill, débit améliorés « de plusieurs ordres de grandeur »
Propriété notable le préfill peut sortir tôt sans changer la sortie

Où il s'arrête : 1 M, et l'évaluation de rappel repose sur l'aiguille dans une botte de foin — le test que Fondations · 04 juge trop facile.

Unlimiformer

On The Adaptation of Unlimiformer for Decoder-Only Transformers · d'après Bertsch et al., NeurIPS 2024 · arXiv:2410.01637

L'attention croisée est déportée sur un index de plus proches voisins. La mémoire n'est plus lue en entier : elle est interrogée.

Où il s'arrête : l'index kNN n'est pas différentiable, ce qui limite l'entraînement de bout en bout — précisément ce que NSA corrigera.


Compression en tokens de mémoire

Gist Tokens

Learning to Compress Prompts with Gist Tokens · Jesse Mu, Xiang Lisa Li, Noah Goodman (Stanford) · NeurIPS 2023 · arXiv:2304.08467

Le résultat fondateur, et d'une élégance rare : la compression s'obtient en modifiant seulement le masque d'attention, sans architecture nouvelle ni surcoût d'entraînement.

Jusqu'à 26× de compression, −40 % de FLOPs, perte de qualité minime.

AutoCompressor

Adapting Language Models to Compress Contexts · Alexis Chevalier, Alexander Wettig, Anirudh Ajith, Danqi Chen (Princeton) · EMNLP 2023 · arXiv:2305.14788 · code

Des vecteurs de résumé produits récursivement, segment par segment, et réinjectés comme invites douces. Séquences allant jusqu'à 30 720 tokens.

Apport principal pour notre sujet : les vecteurs peuvent être précalculés pour un corpus entier — c'est l'argument du cache.

ICAE

In-context Autoencoder for Context Compression in a Large Language Model · Tao Ge et al. · arXiv:2307.06945 · code

Formalise le schéma encodeur–décodeur : pré-entraînement par autoencodage et modélisation du langage, puis affinage sur instructions. 4× de compression pour environ 1 % de paramètres supplémentaires.

C'est de ce travail que vient l'objectif de reconstruction proposé au chapitre précédent.

Activation Beacon

Long Context Compression with Activation Beacon · ICLR 2025 · arXiv:2401.03462

Des jetons « balises » entrelacés avec les jetons bruts, ce qui donne à chaque balise une portée d'attention différenciée et donc une compression à grain fin. Compression et génération dans une seule passe avant, sans second modèle.


Mémoire compressive et sélection

Infini-attention

Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention · Google · 2024 · arXiv:2404.07143

Place une mémoire compressive et l'attention locale dans le même bloc, pour une mémoire et un calcul bornés. Plus de 100× de taux de compression par rapport aux Memorizing Transformers.

C'est le cousin conceptuel de KDA : un état de taille fixe, mais intégré à une couche d'attention plutôt qu'en remplacement.

NSA

Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention · DeepSeek · ACL 2025 · arXiv:2502.11089

Trois voies combinées, exactement la structure proposée au chapitre précédent :

  1. compression de blocs (grain grossier) ;
  2. sélection des blocs pertinents (grain fin) ;
  3. fenêtre glissante (précision locale).

Paramètres publiés : blocs de compression de 32 avec pas de 16, blocs sélectionnés de 64, 16 blocs retenus, fenêtre de 512.

L'apport décisif de NSA

NSA est nativement entraînable — la sélection est différentiable, contrairement à un index kNN. C'est ce qui permet d'entraîner le modèle et son mécanisme de récupération ensemble, au lieu de greffer une recherche documentaire sur un modèle figé.

C'est cette propriété qui rend le point 5 de la proposition réaliste.

Cartridges

Cartridges: Lightweight and general-purpose long context representations via self-study · Sabri Eyuboglu et al. (Stanford) · 2025 · arXiv:2506.06266 · code

Le renversement le plus intéressant : au lieu de calculer une mémoire à l'inférence, on l'entraîne hors ligne. Un corpus est compressé en un cache clé-valeur de taille fixe, entraînable, qui s'intègre directement dans les serveurs d'inférence existants.

Résultat Valeur
Mémoire 38,6× moins qu'un apprentissage en contexte
Débit 26,4× plus
Compression 10 à 100×

Pertinence pour un usage d'entreprise — celui que vise précisément Isaac : si le corpus est stable (base de code, corpus juridique, documentation), le compresser une fois pour toutes est bien plus efficace que le réencoder à chaque requête.


Synthèse

Travail Encodeur séparé Cacheable Sélection Entraînable de bout en bout Contexte atteint
Gist Tokens non oui non oui invite
AutoCompressor non oui non oui 30 K
ICAE oui oui non oui —
Activation Beacon non oui non oui 100 K+
Infini-attention non non non oui « infini »
CEPE oui oui non oui 128 K
YOCO partiel oui non oui 1 M
Unlimiformer oui oui oui non —
NSA non oui oui oui 64 K
Cartridges hors ligne oui non oui corpus

La case vide

Aucune ligne ne combine tout, et aucune ne va à 10 M.

Les briques existent séparément : CEPE pour l'encodeur parallèle, NSA pour la sélection différentiable, Cartridges pour la mémoire apprise. Personne ne les a assemblées publiquement, et personne n'a publié à cette échelle.

C'est très exactement l'espace où Pokee revendique ses cinq brevets. Si Isaac fonctionne comme annoncé, son apport se situe dans cet assemblage — pas dans l'invention d'une brique nouvelle.

Les trois papiers à lire en premier

  1. CEPE — l'encodeur parallèle, la structure de base.
  2. NSA — la sélection, qui débloque tout le dimensionnement.
  3. Cartridges — la mémoire apprise plutôt que calculée.