Aller au contenu

Affirmations à vérifier

Chaque revendication de Pokee, son niveau de preuve, et la manière de la tester.

Échelle de niveau de preuve

Niveau Signification
A Vérifiable publiquement et vérifié
B Contraint par l'arithmétique — établi sans avoir à croire Pokee
C Déclaration du constructeur, cohérente avec le reste
D Déclaration du constructeur, invérifiable
E Déclaration contredite par l'analyse

Le tableau

# Affirmation Niveau Commentaire
A11 0,15 $/M en entrée, 1 $/M en sortie A Publié, confirmé par un revendeur tiers
A2 Contexte de 10 M de tokens C L'API l'annonce ; personne ne l'a testé publiquement
A1 28 milliards de paramètres C Probablement un total, pas des actifs — voir A8
— Architecture hybride à activation creuse B Établi par l'arithmétique, non déclaré par Pokee
— Pas d'attention globale sur 10 M B Établi : 10× hors budget de temps
— Nettement moins de 28 G actifs par token B Établi : dense hors budget même en FP4
A5 10 M de tokens sur RTX 4090 E Contredit : 962 octets/token disponibles, 2 048 requis pour une seule couche
A6 Architecture non purement décodeur D Rien de publié ; interprétation la plus probable : un encodeur de contexte
A10 ≈ 5× de cache KV à VRAM égale D Plausible, mais très insuffisant seul — n'est pas le mécanisme principal
A8 137 200 tokens/s de préfill sur B200 D Non reproduit. Contraignant : implique une activation creuse
A7 93,3 % RULER à 10 M D Protocole non publié ; RULER n'est pas standardisé à cette longueur
A9 Devant BFCL v4 et τ³-bench D Écart de 0,33 point sur BFCL — dans le bruit
— 74,3 MRCR v2 à 512 K D Publié par Pokee ; le chiffre le plus honnête du lot
— Base Qwen3.6-27B partiellement affinée C Déclaré, cohérent avec toute l'analyse
— RL sur 9 verticales d'entreprise D Crédible vu le parcours du fondateur ; aucun détail
— 5 brevets provisoires D Non consultables avant mi-2027
A3 « Premier vrai modèle 10 M » E Llama 4 Scout annonçait 10 M en avril 2025. Le « vrai » dépend entièrement de A7, mesure interne
A4 « Classe frontière » E Contredit : 46ᵉ sur 132 en agentique, catégories majeures non mesurées
— 35,6 de taux de succès d'attaque (DTAP) C Publié avec l'aveu que la mesure est « garde-fous inactifs »

Les quatre questions à poser en priorité

1. « 10 M de tokens et RTX 4090, est-ce simultané ? »

La question la plus importante. L'arithmétique dit non. La réponse de Pokee à cette question, si elle est claire, dira beaucoup sur sa rigueur — et si elle est évasive, également.

Test possible sans Pokee : demander la longueur de contexte maximale supportée sur 24 Go de VRAM. Si la réponse est de l'ordre de 100 K à 500 K, la communication était trompeuse. Si elle est de 10 M, l'architecture est bien plus inhabituelle que ce rapport ne le suppose — et ce serait le vrai sujet.

2. « Quel est le protocole RULER à 10 M ? »

De quoi est faite la botte de foin ? Quelles catégories ? Combien d'aiguilles, à quelles positions ? Sans cela, 93,3 n'est comparable à rien.

3. « Quel est le débit de génération, pas seulement le préfill ? »

Un préfill à 137 200 tokens/s suivi d'une génération lente serait un mauvais compromis pour un agent, qui alterne lecture et écriture en permanence.

4. « Isaac est-il évalué avec ou sans son harness, et les concurrents ? »

Sur BFCL v4, où l'écart est de 0,33 point, cette seule question rend le classement indécidable.


Ce qui changerait l'analyse

Événement Effet
Contribution de code à vLLM ou SGLang Rendrait l'architecture lisible — le levier le plus probable
Publication d'un vrai rapport technique Remplacerait tout ce rapport
Évaluation indépendante sur RULER et MRCR Trancherait A7
Publication des demandes de brevet (mi-2027) Documenterait le mécanisme
Test public de rappel positionnel via l'API Discriminerait entre les hypothèses du chapitre 04
Ouverture des poids Rendrait tout vérifiable

Ce que ce rapport affirme, et sur quelle base

Par symétrie, les conclusions propres à ce rapport et leur fondement :

Conclusion Fondement
Un cache classique à 10 M pèse 2,62 To Calcul, hypothèse de forme explicite
Le facteur ×5 laisse encore 524 Go Calcul direct
Une RTX 4090 offre 962 octets/token à 10 M Calcul, hypothèses de quantification explicites
Une B200 en offre 17 601, soit ≈ 8 couches Calcul
Une couche d'attention globale à 10 M coûte 12 min Calcul, spécifications B200 publiques, MFU 50 %
Un dense 28 G ne tient pas dans le budget de préfill Calcul
Isaac est nécessairement hybride et creux Déduction des quatre précédents
Isaac emploie probablement un encodeur de contexte Hypothèse, signalée comme telle

Limites de ce rapport lui-même

Les hypothèses de forme (64 couches, GQA 8×128) sont empruntées à Qwen3-32B et peuvent être fausses. Une erreur de ±50 % sur ces valeurs déplacerait tous les budgets d'un facteur 2 — sans annuler aucune conclusion, puisque les écarts établis sont de deux à trois ordres de grandeur.

Le rendement de 50 % (MFU) est une convention généreuse. Un rendement plus faible renforcerait les conclusions ; un rendement de 100 %, physiquement inatteignable, ne les annulerait pas.

Toutes les valeurs sont recalculables : Annexes · Vérification arithmétique.