Pokee-Isaac 28B — 10 millions de tokens de contexte¶
Pokee AI · annoncé le 4 août 2026 · poids fermés
Le 4 août 2026, la start-up Pokee AI annonce Pokee-Isaac 28B : un modèle agentique de 28 milliards de paramètres avec une fenêtre de contexte de 10 millions de tokens, soit environ dix fois la limite des modèles grand public de l'époque, déployable — selon l'annonce — « sur un seul GPU, à partir d'une RTX 4090 ».
L'annonce attribue cette capacité à une « nouvelle architecture propriétaire non purement décodeur » (non-decoder-only).
La question de ce rapport¶
Comment ont-ils fait pour atteindre 10 M de tokens ?
La réponse honnête, et il faut la poser d'emblée :
Pokee n'a pas publié le mécanisme
Ni l'architecture, ni le mécanisme d'attention, ni le schéma de gestion mémoire, ni la recette d'entraînement ne sont documentés publiquement. La page « rapport détaillé » de Pokee ne contient que des résultats de benchmarks et une comparaison de prix. Il n'y a ni papier arXiv, ni poids ouverts, ni fichier de configuration à inspecter.
Toute personne qui vous décrit « l'architecture d'Isaac » en détail l'invente.
Ce rapport fait donc autre chose, et c'est là son intérêt : au lieu de recopier un mécanisme inconnu, il encadre ce mécanisme. Les chiffres publiés — 10 M de tokens, un GPU, 137 200 tokens/seconde de préfill — sont des contraintes physiques. On peut calculer ce qu'elles autorisent et ce qu'elles interdisent.
Résultat : ces contraintes éliminent la quasi-totalité de l'espace des architectures possibles, et ce qui reste ressemble beaucoup à une famille d'architectures déjà connue publiquement.
Objectif et public¶
| Objectif | Comprendre ce qui est établi, ce qui est revendiqué, et ce qui est déductible sur Pokee-Isaac 28B |
| Public | Toute personne curieuse des modèles de langage — aucun prérequis |
| Prérequis | Aucun : la partie Fondations construit tout le vocabulaire |
| Durée de lecture | 2 h à 3 h pour l'ensemble ; 15 min pour le résumé exécutif |
| Niveau | Débutant → intermédiaire (la partie Architecture monte à avancé) |
| Créé le | 6 août 2026 |
| Dernière révision | 6 août 2026 |
Parcours de lecture recommandé¶
Si vous voulez juste la réponse (15 min) : Résumé exécutif.
Si vous ne connaissez pas le sujet (parcours complet) :
- Fondations — ce qu'est une fenêtre de contexte, pourquoi elle coûte cher, et les grandes familles de solutions connues.
- Présentation — l'entreprise, l'annonce, l'accès.
- Architecture — le cœur du rapport : ce que Pokee révèle, et ce que l'arithmétique impose.
- Entraînement — le peu qui est connu, et son ampleur.
- Évaluations — les scores annoncés et comment les lire.
- Analyse critique — forces, limites, affirmations à vérifier.
- Prospective — partie spéculative, clairement séparée : que donnerait la combinaison des briques publiques ?
- Annexes — glossaire, spécifications, vérifications, sources.
Si vous connaissez déjà les LLM : sautez directement à Architecture · 02 · L'arithmétique de la mémoire.
Ce que ce rapport apporte¶
Vérifications réalisées pour ce rapport
Un script Python autonome (sans dépendance) recalcule les contraintes physiques imposées par les chiffres annoncés. Il établit trois résultats :
- Un cache clé-valeur classique à 10 M de tokens pèserait 2,62 To ; la réduction « ×5 » annoncée par Pokee le ramènerait à 524 Go — encore très au-delà de n'importe quel GPU unique.
- Le budget mémoire réel d'une RTX 4090 ne suffit pas à une seule couche d'attention complète à 10 M de tokens ; celui d'une B200 en autorise environ 8 (sur ~64).
- Le débit annoncé de 137 200 tokens/s interdit à la fois l'attention globale dense (10× hors budget, même pour une seule couche) et un modèle dense de 28 milliards de paramètres actifs.
Avertissements méthodologiques¶
Tous les benchmarks cités sont internes
Aucune évaluation indépendante de Pokee-Isaac 28B n'était disponible à la date de rédaction (6 août 2026), deux jours après l'annonce. Les scores RULER, BFCL v4, τ³-bench, Terminal-Bench et MRCR proviennent de la page de comparaison publiée par Pokee elle-même, qui la qualifie de « résumé de benchmarks internes ».
Une partie est de la conception, pas de l'analyse
La partie Prospective est un exercice de conception : assembler les briques publiques (KDA de Kimi, iRoPE de Meta, encodeur de contexte) et vérifier par le calcul si l'ensemble tiendrait.
Elle ne décrit l'architecture d'aucun modèle existant, et surtout pas celle d'Isaac. Rien de ce qu'elle contient ne doit être cité comme une information sur Pokee.
Deux revendications à ne pas fusionner
« 10 M de tokens » et « déployable sur une RTX 4090 » sont annoncés dans la même phrase, mais rien n'indique qu'ils soient valables simultanément. L'arithmétique suggère fortement que non. Voir architecture/02.
Sources principales¶
- Page modèle officielle — console.pokee.ai/model
- Site officiel — pokee.ai
- Annonce du fondateur sur LinkedIn
- Annonce sur X — @Pokee_AI
- Fiche BenchLM.ai
Liste complète : Annexes · Sources.