Aller au contenu

Ce que Pokee révèle réellement

Inventaire exhaustif des indices architecturaux publics au 6 août 2026. Il est court.


Les six indices

Indice 1 — « Architecture propriétaire non purement décodeur »

C'est la seule déclaration architecturale directe. Elle est formulée de deux façons selon les sources : non-decoder-only (annonce) et non-pure decoder-only (reprises presse).

Ce que cela exclut : une pile unique de blocs identiques traitant l'entrée et la sortie de la même manière — le schéma de GPT, Llama, Qwen, Mistral et de la quasi-totalité des modèles de langage depuis 2020.

Ce que cela peut vouloir dire :

Lecture Mécanisme correspondant
Encodeur–décodeur Un encodeur compresse le contexte, le décodeur y accède par attention croisée
Pile hétérogène Des couches de natures différentes empilées (linéaire + attention)
Module de mémoire Un composant dédié, hors de la pile principale, qui stocke et restitue

La deuxième lecture est la plus faible : beaucoup appelleraient encore « décodeur » une pile hybride. Le choix de la formule « non-decoder-only » plutôt que « architecture hybride » — terme parfaitement établi en 2026 — suggère plutôt la première ou la troisième.

Interprétation retenue

L'hypothèse la plus économique est un encodeur qui compresse le contexte long en une mémoire compacte, consultée par un décodeur. Cela expliquerait à la fois la formule employée, l'empreinte mémoire, et le débit de préfill élevé — un encodeur peut traiter les blocs en parallèle, contrairement à un décodeur causal.

C'est une hypothèse. Elle est développée au chapitre 04.


Indice 2 — « ≈ 5× de cache KV à VRAM égale »

Formulé sur le site de Pokee : « ~5× KV cache / same VRAM ».

Ce que cela dit : à mémoire vidéo constante, Isaac stocke environ cinq fois plus de tokens qu'un modèle de référence non nommé.

Ce que cela ne dit pas : quelle est la référence, et surtout — c'est le point du chapitre 02 — ce facteur 5 est deux ordres de grandeur trop petit pour expliquer à lui seul le passage de 1 M à 10 M sur un GPU unique.

Lecture cohérente

Le facteur 5 décrit probablement la compression des quelques couches d'attention réelle qui subsistent, et non le mécanisme global. C'est un chiffre de communication, pas l'explication.


Indice 3 — 28 milliards de paramètres

Annoncé sans précision. Rien n'indique s'il s'agit de paramètres totaux ou actifs, ni si le modèle est dense ou à mélange d'experts.

Le chapitre 03 montre que le débit annoncé est incompatible avec 28 milliards de paramètres actifs par token. Si les deux chiffres sont exacts, « 28B » désigne donc un total, et le modèle active nettement moins.


Indice 4 — Partiellement affiné depuis Qwen3.6-27B

Formulation de Pokee, relayée par plusieurs sources :

While some weights are fine-tuned from Qwen3.6-27B under Apache 2.0, Isaac is not a conventional Qwen fine-tune and other weights of Isaac are trained from scratch by the Pokee AI team.

C'est l'indice le plus riche du lot.

Ce qu'on en déduit

Une partie des poids provient de Qwen3.6-27B, donc conserve sa forme : même dimension de modèle, même dimension de FFN, très probablement même vocabulaire et même tokeniseur. Ce sont typiquement les couches « transférables » : plongements, réseaux à propagation avant, normalisations.

Une autre partie est entraînée de zéro. Ce sont, logiquement, précisément les couches de mélange de tokens — c'est-à-dire le mécanisme d'attention/mémoire, qui n'a pas d'équivalent dans Qwen et ne peut donc rien hériter.

Cette recette porte un nom dans la littérature : la conversion d'architecture (linearization, architecture distillation). On part d'un transformeur pré-entraîné, on remplace ses couches d'attention par des couches à état de taille fixe, et on ré-entraîne uniquement ces dernières — pour une fraction du coût d'un pré-entraînement complet.

Cela explique aussi comment une start-up de 12 M$ d'amorçage peut produire un modèle de 28 milliards de paramètres : elle ne l'a pas pré-entraîné.

Cette déduction est cohérente avec tout le reste, et c'est le fil le plus solide du rapport.


Indice 5 — Cinq brevets provisoires sur la conception de modèles à long contexte

Non publiés, non consultables. Voir Présentation · 01.

Leur nombre est en soi une information faible : cinq mécanismes distincts suggèrent un ensemble de techniques combinées plutôt qu'une idée unique.


Indice 6 — Support vLLM et SGLang, et cibles matérielles

Le modèle est annoncé pour vLLM, SGLang, RTX 4090, Intel Arc Pro B70 et NPU mobile Qualcomm.

Ce que la cible NPU mobile implique : quelques gigaoctets de mémoire au total. Un modèle de 28 milliards de paramètres n'y tient qu'en 4 bits ou moins (≈ 14 Go — déjà au-delà de la plupart des NPU mobiles, sauf à activer une fraction des paramètres). Et surtout, aucun contexte long n'y est possible si la mémoire croît avec la longueur.

Cette cible est donc, indirectement, une confirmation forte que la mémoire du modèle est majoritairement de taille fixe.


Le tableau des absences

Ce qui n'est pas publié, et qui serait nécessaire pour reproduire quoi que ce soit :

Information Publiée ?
Nombre de couches, dimension du modèle Non
Nature des couches de mélange Non
Ratio couches linéaires / couches d'attention Non
Dense ou mélange d'experts, paramètres actifs Non
Encodage de position Non
Schéma de gestion mémoire Non
Données, volume, budget de calcul Non
Procédure d'extension du contexte Non
Méthode de RL Non
Poids Non
Papier ou rapport technique détaillé Non

Conséquence méthodologique

Aucune affirmation de Pokee sur son architecture n'est falsifiable en l'état. Le seul levier disponible est l'arithmétique — c'est l'objet des deux chapitres suivants — et, à terme, le code d'intégration dans vLLM ou SGLang, qui rendrait l'architecture lisible.


Chapitre suivant : L'arithmétique de la mémoire