Aller au contenu

Pokee-Isaac 28B — 10 millions de tokens de contexte

Pokee AI · annoncé le 4 août 2026 · poids fermés

Le 4 août 2026, la start-up Pokee AI annonce Pokee-Isaac 28B : un modèle agentique de 28 milliards de paramètres avec une fenêtre de contexte de 10 millions de tokens, soit environ dix fois la limite des modèles grand public de l'époque, déployable — selon l'annonce — « sur un seul GPU, à partir d'une RTX 4090 ».

L'annonce attribue cette capacité à une « nouvelle architecture propriétaire non purement décodeur » (non-decoder-only).


La question de ce rapport

Comment ont-ils fait pour atteindre 10 M de tokens ?

La réponse honnête, et il faut la poser d'emblée :

Pokee n'a pas publié le mécanisme

Ni l'architecture, ni le mécanisme d'attention, ni le schéma de gestion mémoire, ni la recette d'entraînement ne sont documentés publiquement. La page « rapport détaillé » de Pokee ne contient que des résultats de benchmarks et une comparaison de prix. Il n'y a ni papier arXiv, ni poids ouverts, ni fichier de configuration à inspecter.

Toute personne qui vous décrit « l'architecture d'Isaac » en détail l'invente.

Ce rapport fait donc autre chose, et c'est là son intérêt : au lieu de recopier un mécanisme inconnu, il encadre ce mécanisme. Les chiffres publiés — 10 M de tokens, un GPU, 137 200 tokens/seconde de préfill — sont des contraintes physiques. On peut calculer ce qu'elles autorisent et ce qu'elles interdisent.

Résultat : ces contraintes éliminent la quasi-totalité de l'espace des architectures possibles, et ce qui reste ressemble beaucoup à une famille d'architectures déjà connue publiquement.


Objectif et public

Objectif Comprendre ce qui est établi, ce qui est revendiqué, et ce qui est déductible sur Pokee-Isaac 28B
Public Toute personne curieuse des modèles de langage — aucun prérequis
Prérequis Aucun : la partie Fondations construit tout le vocabulaire
Durée de lecture 2 h à 3 h pour l'ensemble ; 15 min pour le résumé exécutif
Niveau Débutant → intermédiaire (la partie Architecture monte à avancé)
Créé le 6 août 2026
Dernière révision 6 août 2026

Parcours de lecture recommandé

Si vous voulez juste la réponse (15 min) : Résumé exécutif.

Si vous ne connaissez pas le sujet (parcours complet) :

  1. Fondations — ce qu'est une fenêtre de contexte, pourquoi elle coûte cher, et les grandes familles de solutions connues.
  2. Présentation — l'entreprise, l'annonce, l'accès.
  3. Architecture — le cœur du rapport : ce que Pokee révèle, et ce que l'arithmétique impose.
  4. Entraînement — le peu qui est connu, et son ampleur.
  5. Évaluations — les scores annoncés et comment les lire.
  6. Analyse critique — forces, limites, affirmations à vérifier.
  7. Prospective — partie spéculative, clairement séparée : que donnerait la combinaison des briques publiques ?
  8. Annexes — glossaire, spécifications, vérifications, sources.

Si vous connaissez déjà les LLM : sautez directement à Architecture · 02 · L'arithmétique de la mémoire.


Ce que ce rapport apporte

Vérifications réalisées pour ce rapport

Un script Python autonome (sans dépendance) recalcule les contraintes physiques imposées par les chiffres annoncés. Il établit trois résultats :

  1. Un cache clé-valeur classique à 10 M de tokens pèserait 2,62 To ; la réduction « ×5 » annoncée par Pokee le ramènerait à 524 Go — encore très au-delà de n'importe quel GPU unique.
  2. Le budget mémoire réel d'une RTX 4090 ne suffit pas à une seule couche d'attention complète à 10 M de tokens ; celui d'une B200 en autorise environ 8 (sur ~64).
  3. Le débit annoncé de 137 200 tokens/s interdit à la fois l'attention globale dense (10× hors budget, même pour une seule couche) et un modèle dense de 28 milliards de paramètres actifs.

Voir Annexes · Vérification arithmétique.


Avertissements méthodologiques

Tous les benchmarks cités sont internes

Aucune évaluation indépendante de Pokee-Isaac 28B n'était disponible à la date de rédaction (6 août 2026), deux jours après l'annonce. Les scores RULER, BFCL v4, τ³-bench, Terminal-Bench et MRCR proviennent de la page de comparaison publiée par Pokee elle-même, qui la qualifie de « résumé de benchmarks internes ».

Une partie est de la conception, pas de l'analyse

La partie Prospective est un exercice de conception : assembler les briques publiques (KDA de Kimi, iRoPE de Meta, encodeur de contexte) et vérifier par le calcul si l'ensemble tiendrait.

Elle ne décrit l'architecture d'aucun modèle existant, et surtout pas celle d'Isaac. Rien de ce qu'elle contient ne doit être cité comme une information sur Pokee.

Deux revendications à ne pas fusionner

« 10 M de tokens » et « déployable sur une RTX 4090 » sont annoncés dans la même phrase, mais rien n'indique qu'ils soient valables simultanément. L'arithmétique suggère fortement que non. Voir architecture/02.


Sources principales

Liste complète : Annexes · Sources.