Résumé exécutif¶
Quinze minutes pour l'essentiel.
Ce qui est annoncé¶
Le 4 août 2026, Pokee AI publie Pokee-Isaac 28B, présenté comme « le premier vrai modèle agentique de classe frontière à 10 M de tokens de contexte, déployable sur un seul GPU ».
Ce n'est pas le premier modèle à 10 M — et le mot « vrai » le sait
Llama 4 Scout (Meta, avril 2025) annonçait déjà 10 millions de tokens, en poids ouverts et avec son architecture documentée. Entraîné à 256 K et extrapolé d'un facteur 39, il s'est effondré à 15,6 % sur un test de compréhension à 128 K, là où Gemini 2.5 Pro obtenait 90,6 %.
La revendication de Pokee porte donc sur la qualité de la fenêtre, pas sur sa taille. Elle est légitime en principe — mais la chute de Scout n'a été révélée que par des évaluations indépendantes, et il n'en existe aucune pour Isaac. Voir Fondations · 05.
| Caractéristique | Valeur annoncée |
|---|---|
| Paramètres | 28 milliards |
| Fenêtre de contexte | 10 000 000 tokens |
| Sortie maximale | 60 000 tokens |
| Modalités | Texte uniquement |
| Architecture | « Non purement décodeur », propriétaire |
| Cache clé-valeur | « ≈ 5× à VRAM égale » |
| Préfill | jusqu'à 137 200 tokens/s sur une B200 |
| Prix API | 0,15 $ / M en entrée · 1,00 $ / M en sortie |
| Poids | Fermés |
| Déploiement | API, VPC client, sur site, embarqué (vLLM / SGLang) |
La réponse courte à « comment ? »¶
Pokee ne le dit pas. L'entreprise revendique cinq brevets provisoires sur la conception de modèles à long contexte, et se contente publiquement de l'étiquette « architecture non purement décodeur ». Aucun mécanisme d'attention, aucun schéma de gestion mémoire, aucune recette d'entraînement n'est documenté.
Mais les chiffres publiés contraignent fortement la réponse. Trois calculs, détaillés dans la partie Architecture et vérifiés par script :
1. La mémoire interdit l'attention classique¶
Un décodeur de forme classique (64 couches, attention groupée 8 têtes × 128 dimensions, demi-précision) stocke 256 Kio par token. À 10 M de tokens, cela fait 2,62 To. La réduction « ×5 » revendiquée le ramène à 524 Go : c'est toujours 2,7 fois la mémoire d'une B200, et 22 fois celle d'une RTX 4090.
Donc « ×5 sur le cache » ne peut pas être l'explication principale. Il faut une réduction de deux ordres de grandeur supplémentaires, ce qui n'est possible que si la mémoire de la plupart des couches cesse de croître avec la longueur.
2. La RTX 4090 ne tient pas 10 M de tokens¶
Après les poids du modèle (≈ 14 Go en 4 bits) et les tampons, une 4090 laisse environ 962 octets par token à 10 M de tokens. Une seule couche d'attention complète en 8 bits en consomme 2 048. Pas même une couche ne rentre.
Une B200 (192 Go) laisse ≈ 17 600 octets/token, soit environ 8 couches sur ~64. C'est cohérent avec un modèle hybride — et c'est bien sur B200 que Pokee mesure ses chiffres phares.
3. Le débit interdit l'attention globale¶
À 137 200 tokens/s, un préfill de 10 M de tokens prend 73 secondes. Or une seule couche d'attention causale dense sur 10 M de tokens coûte 1,64 × 10¹⁸ FLOPs, soit ≈ 12 minutes sur une B200 à rendement réaliste — dix fois le budget total.
Le même budget interdit aussi un modèle dense de 28 milliards de paramètres : il faudrait 56 GFLOPs par token, alors que le budget plafonne à 33 GFLOPs par token même en FP4.
Ce que cela laisse comme architecture possible¶
Les trois contraintes ne sont satisfaites simultanément que par un modèle qui combine :
- une majorité de couches à état de taille fixe — attention linéaire, modèle d'état (SSM), ou couche récurrente — dont la mémoire ne dépend pas de la longueur ;
- une minorité de couches d'attention réelle, non globales : fenêtre glissante, attention creuse, ou attention sur une mémoire compressée ;
- une activation creuse des paramètres (mélange d'experts), ou une quantification très agressive, pour tenir le débit ;
- très probablement un composant encodeur qui compresse le contexte en une mémoire compacte — c'est l'interprétation la plus naturelle de « non purement décodeur ».
C'est exactement la famille d'architectures hybrides déjà publiée ailleurs (Jamba, MiniMax-01, Qwen3-Next, Kimi Linear…). L'innovation de Pokee, si elle existe, est dans le détail — pas dans la famille. Voir architecture/04.
Ce qui est connu de l'entraînement¶
Très peu :
- une partie des poids est affinée depuis Qwen3.6-27B (licence Apache 2.0) ;
- les autres poids sont, selon Pokee, entraînés de zéro par ses équipes — Isaac n'est donc pas un simple fine-tune de Qwen ;
- le modèle a été entraîné par renforcement sur neuf verticales d'entreprise : finance, santé, e-commerce, éducation, industrie, etc. ;
- Pokee détient cinq brevets provisoires sur la conception de modèles à long contexte.
Aucun volume de données, aucun budget de calcul, aucune phase d'extension de contexte, aucune méthode de RL n'est publiée. Voir Entraînement.
Les scores annoncés¶
| Benchmark | Isaac | Remarque |
|---|---|---|
| RULER @ 256 K | 96,9 | |
| RULER @ 1 M | 95,0 | |
| RULER @ 10 M | 93,3 | Les 5 modèles comparés échouent au-delà de 2 M |
| MRCR v2 @ 512 K | 0,743 | Bien plus dur que RULER |
| BFCL v4 (appel d'outils) | 70,94 | devant GPT-5.6 Luna (70,61) |
| τ³-bench (multi-tours) | 0,662 | |
| Terminal-Bench 2.1 | 65,1 % | 2ᵉ du panel |
| MCP-Atlas | 74,6 | |
| DTAP (taux de succès d'attaque) | 35,6 | le plus bas du panel |
Tous internes, aucun reproduit indépendamment à ce jour. Et une nuance importante : la comparaison « les autres tombent à 0 au-delà de 2 M » compare surtout des modèles qui n'acceptent pas 2 M de tokens en entrée. Voir évaluations/02.
Verdict provisoire¶
Ce qui est solide
- Le positionnement est cohérent : petit modèle, long contexte, agentique, déployable chez le client, prix bas.
- Le fondateur, Zheqing (Bill) Zhu, a dirigé l'apprentissage par renforcement appliqué chez Meta AI et détient un doctorat de Stanford en RL. Le tour de table de 12 M$ (Point72 Ventures, Qualcomm Ventures, Samsung NEXT, SCB10X) implique une diligence institutionnelle préalable.
- L'arithmétique n'invalide rien : une architecture hybride peut atteindre ces chiffres sur B200.
Ce qui reste à démontrer
- Aucune vérification indépendante à ce jour — or c'est exactement ce qui avait démonté la fenêtre de 10 M de Llama 4 Scout.
- « Premier » est faux (Scout, avril 2025) ; « vrai » est invérifiable.
- « 10 M sur RTX 4090 » est arithmétiquement très improbable ; les deux revendications sont probablement disjointes.
- RULER à 10 M n'est pas un protocole standardisé : la construction de la « botte de foin » à cette échelle change tout le résultat.
- Aucun poids, aucun papier : rien n'est falsifiable.
- Modèle texte seul, et les refus explicites sur tâches malveillantes ne couvrent que 1,5 % des cas selon Pokee elle-même.