Ce qui est annoncé, affirmation par affirmation¶
L'annonce¶
Le 4 août 2026, Pokee AI publie sur X et LinkedIn :
Releasing Pokee-Isaac 28B — the world's first real 10M-token context frontier-class agentic model, deployable on a single GPU (starting from RTX 4090 or equivalent). New proprietary non-decoder-only architecture: 93.3 % RULER at 10M tokens · Up to 137K tokens/s prefill on one B200 with 10M-token context · Leads BFCL v4 and τ³-bench · $0.15/M in, $1/M out · vLLM and SGLang support.
Sur la date
Les sources divergent d'un ou deux jours : BenchLM indique le 3 août 2026, l'annonce X/LinkedIn le 4 août, la couverture presse le 5 août. Ce rapport retient le 4 août 2026 comme date d'annonce publique.
Décomposition en affirmations testables¶
Une annonce dense mélange des choses de natures très différentes. Les séparer est la première étape de l'analyse.
| # | Affirmation | Nature | Vérifiable ? |
|---|---|---|---|
| A1 | 28 milliards de paramètres | Fait déclaré | Non (poids fermés) |
| A2 | Contexte de 10 M de tokens | Fait déclaré | Partiellement (l'API l'accepte-t-elle ?) |
| A3 | « Premier vrai » modèle 10 M | Revendication d'antériorité | Contestable par définition de « vrai » |
| A4 | « Classe frontière » | Revendication qualitative | Non défini |
| A5 | Déployable sur un seul GPU, à partir d'une RTX 4090 | Fait technique | Testable — et douteux à 10 M |
| A6 | Architecture propriétaire non purement décodeur | Fait technique | Non (rien n'est publié) |
| A7 | 93,3 % RULER à 10 M | Mesure interne | Non reproduite |
| A8 | Jusqu'à 137 200 tokens/s de préfill sur une B200 | Mesure interne | Contraignante — voir Architecture |
| A9 | Devant BFCL v4 et τ³-bench | Mesure interne comparative | Panel choisi par Pokee |
| A10 | ≈ 5× de cache KV à VRAM égale | Mesure interne | Contraignante — voir Architecture |
| A11 | 0,15 $ / 1 $ par million de tokens | Fait commercial | Oui, publié |
Les trois affirmations qui portent l'analyse¶
Ce rapport s'appuie sur A2, A5, A8 et A10 — les seules qui soient à la fois chiffrées et physiquement contraignantes. Elles suffisent à borner l'espace des architectures possibles, sans que Pokee ait à révéler quoi que ce soit.
C'est l'objet de la partie Architecture.
Les affirmations à traiter avec prudence¶
A3 — « Le premier vrai modèle à 10 M de tokens »¶
L'adjectif real fait tout le travail, et il vise une cible précise.
Llama 4 Scout a annoncé 10 M seize mois plus tôt
Meta a publié Llama 4 Scout en avril 2025 avec une fenêtre annoncée de 10 millions de tokens — en poids ouverts, et avec son architecture (iRoPE) documentée.
Pokee ne peut donc pas être « le premier à 10 M ». Sa revendication porte sur la qualité de la fenêtre, pas sur sa taille : Scout, entraîné à 256 K et extrapolé d'un facteur 39, s'est effondré à 15,6 % sur un test de compréhension à 128 K là où Gemini 2.5 Pro obtenait 90,6 %.
L'affirmation de Pokee est donc : « le premier dont les 10 M soient utilisables ». Elle est légitime en principe — mais elle repose entièrement sur A7, une mesure interne, alors que la chute de Scout n'a été établie que par des évaluations indépendantes, qui n'existent pas pour Isaac.
Chapitre complet : Fondations · 05.
A4 — « Classe frontière » (frontier-class)¶
Le terme n'a pas de définition partagée. Les données disponibles ne le soutiennent pas au sens usuel : BenchLM classe Isaac 46ᵉ sur 132 en catégorie agentique, avec un score composite de 50,9/100, et note qu'il « ne se qualifie pas pour un classement général public » faute de couverture suffisante en connaissances, mathématiques, multilingue et suivi d'instructions.
Lecture équitable : Isaac est fort sur une niche — le contexte long et l'usage d'outils — pour un modèle de 28 milliards de paramètres et à un prix bas. Ce n'est pas la même chose que « classe frontière ».
A5 — « Déployable sur une RTX 4090 »¶
La fusion la plus problématique de l'annonce
« 10 M de tokens » et « à partir d'une RTX 4090 » figurent dans la même phrase. Rien n'affirme explicitement que les deux tiennent en même temps — et l'arithmétique montre que non (Architecture · 02).
La lecture cohérente est : le modèle tourne sur une 4090 (à contexte modeste), et atteint 10 M sur une B200. C'est d'ailleurs sur B200 que toutes les mesures de débit sont faites. Mais la phrase, telle qu'écrite, laisse entendre autre chose.
Ce que l'annonce ne dit pas¶
Liste des absences notables, chacune étant une information que publie habituellement un laboratoire lors d'une sortie de modèle :
- le nombre de couches, la dimension du modèle, le nombre de têtes ;
- s'il s'agit d'un modèle dense ou d'un mélange d'experts, et le nombre de paramètres actifs ;
- le mécanisme d'attention et l'encodage de position ;
- le schéma de gestion de la mémoire ;
- le volume et la nature des données d'entraînement ;
- le budget de calcul d'entraînement ;
- la procédure d'extension du contexte ;
- la méthode d'apprentissage par renforcement ;
- la latence au premier token et le débit de génération (seul le préfill est annoncé) ;
- les performances en connaissances, mathématiques, code hors terminal, multilingue.
Chapitre suivant : Accès, prix et déploiement