Ce que Pokee révèle réellement¶
Inventaire exhaustif des indices architecturaux publics au 6 août 2026. Il est court.
Les six indices¶
Indice 1 — « Architecture propriétaire non purement décodeur »¶
C'est la seule déclaration architecturale directe. Elle est formulée de deux façons selon les sources : non-decoder-only (annonce) et non-pure decoder-only (reprises presse).
Ce que cela exclut : une pile unique de blocs identiques traitant l'entrée et la sortie de la même manière — le schéma de GPT, Llama, Qwen, Mistral et de la quasi-totalité des modèles de langage depuis 2020.
Ce que cela peut vouloir dire :
| Lecture | Mécanisme correspondant |
|---|---|
| Encodeur–décodeur | Un encodeur compresse le contexte, le décodeur y accède par attention croisée |
| Pile hétérogène | Des couches de natures différentes empilées (linéaire + attention) |
| Module de mémoire | Un composant dédié, hors de la pile principale, qui stocke et restitue |
La deuxième lecture est la plus faible : beaucoup appelleraient encore « décodeur » une pile hybride. Le choix de la formule « non-decoder-only » plutôt que « architecture hybride » — terme parfaitement établi en 2026 — suggère plutôt la première ou la troisième.
Interprétation retenue
L'hypothèse la plus économique est un encodeur qui compresse le contexte long en une mémoire compacte, consultée par un décodeur. Cela expliquerait à la fois la formule employée, l'empreinte mémoire, et le débit de préfill élevé — un encodeur peut traiter les blocs en parallèle, contrairement à un décodeur causal.
C'est une hypothèse. Elle est développée au chapitre 04.
Indice 2 — « ≈ 5× de cache KV à VRAM égale »¶
Formulé sur le site de Pokee : « ~5× KV cache / same VRAM ».
Ce que cela dit : à mémoire vidéo constante, Isaac stocke environ cinq fois plus de tokens qu'un modèle de référence non nommé.
Ce que cela ne dit pas : quelle est la référence, et surtout — c'est le point du chapitre 02 — ce facteur 5 est deux ordres de grandeur trop petit pour expliquer à lui seul le passage de 1 M à 10 M sur un GPU unique.
Lecture cohérente
Le facteur 5 décrit probablement la compression des quelques couches d'attention réelle qui subsistent, et non le mécanisme global. C'est un chiffre de communication, pas l'explication.
Indice 3 — 28 milliards de paramètres¶
Annoncé sans précision. Rien n'indique s'il s'agit de paramètres totaux ou actifs, ni si le modèle est dense ou à mélange d'experts.
Le chapitre 03 montre que le débit annoncé est incompatible avec 28 milliards de paramètres actifs par token. Si les deux chiffres sont exacts, « 28B » désigne donc un total, et le modèle active nettement moins.
Indice 4 — Partiellement affiné depuis Qwen3.6-27B¶
Formulation de Pokee, relayée par plusieurs sources :
While some weights are fine-tuned from Qwen3.6-27B under Apache 2.0, Isaac is not a conventional Qwen fine-tune and other weights of Isaac are trained from scratch by the Pokee AI team.
C'est l'indice le plus riche du lot.
Ce qu'on en déduit
Une partie des poids provient de Qwen3.6-27B, donc conserve sa forme : même dimension de modèle, même dimension de FFN, très probablement même vocabulaire et même tokeniseur. Ce sont typiquement les couches « transférables » : plongements, réseaux à propagation avant, normalisations.
Une autre partie est entraînée de zéro. Ce sont, logiquement, précisément les couches de mélange de tokens — c'est-à-dire le mécanisme d'attention/mémoire, qui n'a pas d'équivalent dans Qwen et ne peut donc rien hériter.
Cette recette porte un nom dans la littérature : la conversion d'architecture (linearization, architecture distillation). On part d'un transformeur pré-entraîné, on remplace ses couches d'attention par des couches à état de taille fixe, et on ré-entraîne uniquement ces dernières — pour une fraction du coût d'un pré-entraînement complet.
Cela explique aussi comment une start-up de 12 M$ d'amorçage peut produire un modèle de 28 milliards de paramètres : elle ne l'a pas pré-entraîné.
Cette déduction est cohérente avec tout le reste, et c'est le fil le plus solide du rapport.
Indice 5 — Cinq brevets provisoires sur la conception de modèles à long contexte¶
Non publiés, non consultables. Voir Présentation · 01.
Leur nombre est en soi une information faible : cinq mécanismes distincts suggèrent un ensemble de techniques combinées plutôt qu'une idée unique.
Indice 6 — Support vLLM et SGLang, et cibles matérielles¶
Le modèle est annoncé pour vLLM, SGLang, RTX 4090, Intel Arc Pro B70 et NPU mobile Qualcomm.
Ce que la cible NPU mobile implique : quelques gigaoctets de mémoire au total. Un modèle de 28 milliards de paramètres n'y tient qu'en 4 bits ou moins (≈ 14 Go — déjà au-delà de la plupart des NPU mobiles, sauf à activer une fraction des paramètres). Et surtout, aucun contexte long n'y est possible si la mémoire croît avec la longueur.
Cette cible est donc, indirectement, une confirmation forte que la mémoire du modèle est majoritairement de taille fixe.
Le tableau des absences¶
Ce qui n'est pas publié, et qui serait nécessaire pour reproduire quoi que ce soit :
| Information | Publiée ? |
|---|---|
| Nombre de couches, dimension du modèle | Non |
| Nature des couches de mélange | Non |
| Ratio couches linéaires / couches d'attention | Non |
| Dense ou mélange d'experts, paramètres actifs | Non |
| Encodage de position | Non |
| Schéma de gestion mémoire | Non |
| Données, volume, budget de calcul | Non |
| Procédure d'extension du contexte | Non |
| Méthode de RL | Non |
| Poids | Non |
| Papier ou rapport technique détaillé | Non |
Conséquence méthodologique
Aucune affirmation de Pokee sur son architecture n'est falsifiable en l'état. Le seul levier disponible est l'arithmétique — c'est l'objet des deux chapitres suivants — et, à terme, le code d'intégration dans vLLM ou SGLang, qui rendrait l'architecture lisible.
Chapitre suivant : L'arithmétique de la mémoire