Affirmations à vérifier¶
Chaque revendication de Pokee, son niveau de preuve, et la manière de la tester.
Échelle de niveau de preuve¶
| Niveau | Signification |
|---|---|
| A | Vérifiable publiquement et vérifié |
| B | Contraint par l'arithmétique — établi sans avoir à croire Pokee |
| C | Déclaration du constructeur, cohérente avec le reste |
| D | Déclaration du constructeur, invérifiable |
| E | Déclaration contredite par l'analyse |
Le tableau¶
| # | Affirmation | Niveau | Commentaire |
|---|---|---|---|
| A11 | 0,15 $/M en entrée, 1 $/M en sortie | A | Publié, confirmé par un revendeur tiers |
| A2 | Contexte de 10 M de tokens | C | L'API l'annonce ; personne ne l'a testé publiquement |
| A1 | 28 milliards de paramètres | C | Probablement un total, pas des actifs — voir A8 |
| — | Architecture hybride à activation creuse | B | Établi par l'arithmétique, non déclaré par Pokee |
| — | Pas d'attention globale sur 10 M | B | Établi : 10× hors budget de temps |
| — | Nettement moins de 28 G actifs par token | B | Établi : dense hors budget même en FP4 |
| A5 | 10 M de tokens sur RTX 4090 | E | Contredit : 962 octets/token disponibles, 2 048 requis pour une seule couche |
| A6 | Architecture non purement décodeur | D | Rien de publié ; interprétation la plus probable : un encodeur de contexte |
| A10 | ≈ 5× de cache KV à VRAM égale | D | Plausible, mais très insuffisant seul — n'est pas le mécanisme principal |
| A8 | 137 200 tokens/s de préfill sur B200 | D | Non reproduit. Contraignant : implique une activation creuse |
| A7 | 93,3 % RULER à 10 M | D | Protocole non publié ; RULER n'est pas standardisé à cette longueur |
| A9 | Devant BFCL v4 et τ³-bench | D | Écart de 0,33 point sur BFCL — dans le bruit |
| — | 74,3 MRCR v2 à 512 K | D | Publié par Pokee ; le chiffre le plus honnête du lot |
| — | Base Qwen3.6-27B partiellement affinée | C | Déclaré, cohérent avec toute l'analyse |
| — | RL sur 9 verticales d'entreprise | D | Crédible vu le parcours du fondateur ; aucun détail |
| — | 5 brevets provisoires | D | Non consultables avant mi-2027 |
| A3 | « Premier vrai modèle 10 M » | E | Llama 4 Scout annonçait 10 M en avril 2025. Le « vrai » dépend entièrement de A7, mesure interne |
| A4 | « Classe frontière » | E | Contredit : 46ᵉ sur 132 en agentique, catégories majeures non mesurées |
| — | 35,6 de taux de succès d'attaque (DTAP) | C | Publié avec l'aveu que la mesure est « garde-fous inactifs » |
Les quatre questions à poser en priorité¶
1. « 10 M de tokens et RTX 4090, est-ce simultané ? »¶
La question la plus importante. L'arithmétique dit non. La réponse de Pokee à cette question, si elle est claire, dira beaucoup sur sa rigueur — et si elle est évasive, également.
Test possible sans Pokee : demander la longueur de contexte maximale supportée sur 24 Go de VRAM. Si la réponse est de l'ordre de 100 K à 500 K, la communication était trompeuse. Si elle est de 10 M, l'architecture est bien plus inhabituelle que ce rapport ne le suppose — et ce serait le vrai sujet.
2. « Quel est le protocole RULER à 10 M ? »¶
De quoi est faite la botte de foin ? Quelles catégories ? Combien d'aiguilles, à quelles positions ? Sans cela, 93,3 n'est comparable à rien.
3. « Quel est le débit de génération, pas seulement le préfill ? »¶
Un préfill à 137 200 tokens/s suivi d'une génération lente serait un mauvais compromis pour un agent, qui alterne lecture et écriture en permanence.
4. « Isaac est-il évalué avec ou sans son harness, et les concurrents ? »¶
Sur BFCL v4, où l'écart est de 0,33 point, cette seule question rend le classement indécidable.
Ce qui changerait l'analyse¶
| Événement | Effet |
|---|---|
| Contribution de code à vLLM ou SGLang | Rendrait l'architecture lisible — le levier le plus probable |
| Publication d'un vrai rapport technique | Remplacerait tout ce rapport |
| Évaluation indépendante sur RULER et MRCR | Trancherait A7 |
| Publication des demandes de brevet (mi-2027) | Documenterait le mécanisme |
| Test public de rappel positionnel via l'API | Discriminerait entre les hypothèses du chapitre 04 |
| Ouverture des poids | Rendrait tout vérifiable |
Ce que ce rapport affirme, et sur quelle base¶
Par symétrie, les conclusions propres à ce rapport et leur fondement :
| Conclusion | Fondement |
|---|---|
| Un cache classique à 10 M pèse 2,62 To | Calcul, hypothèse de forme explicite |
| Le facteur ×5 laisse encore 524 Go | Calcul direct |
| Une RTX 4090 offre 962 octets/token à 10 M | Calcul, hypothèses de quantification explicites |
| Une B200 en offre 17 601, soit ≈ 8 couches | Calcul |
| Une couche d'attention globale à 10 M coûte 12 min | Calcul, spécifications B200 publiques, MFU 50 % |
| Un dense 28 G ne tient pas dans le budget de préfill | Calcul |
| Isaac est nécessairement hybride et creux | Déduction des quatre précédents |
| Isaac emploie probablement un encodeur de contexte | Hypothèse, signalée comme telle |
Limites de ce rapport lui-même
Les hypothèses de forme (64 couches, GQA 8×128) sont empruntées à Qwen3-32B et peuvent être fausses. Une erreur de ±50 % sur ces valeurs déplacerait tous les budgets d'un facteur 2 — sans annuler aucune conclusion, puisque les écarts établis sont de deux à trois ordres de grandeur.
Le rendement de 50 % (MFU) est une convention généreuse. Un rendement plus faible renforcerait les conclusions ; un rendement de 100 %, physiquement inatteignable, ne les annulerait pas.
Toutes les valeurs sont recalculables : Annexes · Vérification arithmétique.