Sources¶
Toutes les sources consultées pour ce rapport, avec ce que chacune soutient réellement.
Date de consultation : 6 août 2026.
Sources primaires — Pokee AI¶
Ce sont les seules sources de première main. Elles sont toutes commerciales.
console.pokee.ai/model¶
Page « rapport détaillé » officielle. Soutient : les scores RULER (256 K à 10 M), MRCR, BFCL v4, τ³-bench, Terminal-Bench, MCP-Atlas, DTAP ; le panel de comparaison et ses prix ; la mention « texte seul » ; l'aveu que les défenses de sécurité sont « essentiellement incidentelles » et que trois modèles du panel ne peuvent pas être achetés aux longueurs comparées.
Ce qu'elle ne contient pas
Malgré son titre, cette page ne contient aucune information architecturale ni aucun détail d'entraînement. C'est un tableau de benchmarks et de prix.
pokee.ai¶
Site principal. Soutient : « ~5× KV cache / same VRAM » ; « reinforcement-learned across nine enterprise verticals » ; « five provisional patents on long-context model design » ; la distinction modèle / harness d'agent (Plan · Act · Verify · Cite, 90+ outils) ; les modes de déploiement.
Annonce sur X — @Pokee_AI¶
Annonce d'origine du 4 août 2026. Soutient le texte exact des revendications.
Note d'accès
Cette page n'a pas pu être récupérée directement lors de la rédaction (X restreint l'accès automatisé). Le contenu du message a été reconstitué à partir du post LinkedIn identique du fondateur et de plusieurs reprises concordantes.
Annonce du fondateur sur LinkedIn¶
Version LinkedIn de l'annonce, par Zheqing (Bill) Zhu. Soutient : le texte complet de l'annonce ; « new proprietary non-decoder-only architecture » ; la mention de l'affinage partiel depuis Qwen3.6-27B ; les commentaires de la communauté sur la qualité de l'attention et la sélection de contexte.
Sources secondaires — agrégateurs et fiches techniques¶
BenchLM.ai — fiche Pokee-Isaac 28B¶
Agrégateur de benchmarks. Soutient : le composite agentique de 50,9/100 et le rang 46ᵉ sur 132 ; le prix mixte de 0,57 $/M ; MRCR v2 à 60,7 % ; MCP-Atlas à 74,6 ; PinchBench à 95,7 ; la mention que le modèle « ne se qualifie pas pour un classement général public ».
Ce que BenchLM est et n'est pas
BenchLM agrège des scores publiés, il ne les reproduit pas. Ce n'est donc pas une évaluation indépendante — c'est une mise en perspective dans un référentiel commun. C'est utile, et différent.
BenchLM.ai — statistiques des fenêtres de contexte¶
Soutient : au 5 août 2026, la plus grande fenêtre de contexte suivie par BenchLM est celle de Pokee-Isaac 28B, à 10 M de tokens.
NanoGPT — fiche Pokee-Isaac¶
Revendeur d'API. Soutient : la sortie maximale de 60 000 tokens ; les prix revendeur (0,16 $ / 1,05 $ / 0,079 $ en cache) ; la politique de conservation des données (aperçu de 120 caractères 1 jour, charges chiffrées 7 jours) ; la date d'ajout du 4 août 2026.
C'est la source la plus utile pour le tarif de lecture en cache, que Pokee ne publie pas.
Sources de contexte — presse¶
KuCoin News — Pokee AI Launches 28B-Parameter Model with 10M Token Context Window¶
Soutient : la fondation en 2024 ; le parcours de Zhu Zheqing (ancien responsable de l'apprentissage par renforcement appliqué chez Meta) ; le tour d'amorçage de 12 M$ mené par Point72 Ventures avec Qualcomm Ventures et Samsung NEXT ; le fait que le rapport technique ne divulgue ni le mécanisme d'attention ni le schéma de gestion mémoire.
explainx.ai — Pokee-Isaac 28B: 10M-Token Context on One GPU¶
Analyse secondaire. Soutient : l'identification du cache clé-valeur comme obstacle mécanique central ; la mention que « le mécanisme profond vit dans le rapport technique de Pokee » — c'est-à-dire nulle part de public ; la qualification explicite de tous les chiffres comme « résumé de benchmarks internes, non vérifiés indépendamment ».
Utilité et limite
Cette source pose correctement le problème technique, mais ne dispose d'aucune information que Pokee n'ait publiée. Elle ne peut donc pas répondre à la question de l'architecture, et le dit.
Sources sur le précédent Llama 4 Scout¶
Ces sources fondent le chapitre Fondations · 05.
Meta AI — The Llama 4 herd¶
Source primaire. Soutient : Llama 4 Scout à 17 G actifs / 109 G totaux, 16 experts ; la fenêtre annoncée de 10 M de tokens ; l'architecture iRoPE ; et surtout la déclaration que le modèle est « pré-entraîné et post-entraîné avec une longueur de 256 K » — donc que les 10 M relèvent de l'extrapolation.
Soutient également que les seules évaluations de contexte long publiées par Meta sont l'aiguille dans une botte de foin et la vraisemblance négative cumulée sur 10 M de tokens de code.
config.json de Llama 4 Scout¶
Source primaire, et la plus utile de toute cette annexe. Soutient toutes les
valeurs architecturales employées dans les calculs sur Scout : 48 couches,
hidden_size 5120, 40 têtes de requête, 8 têtes clé/valeur, head_dim 128,
attention_chunk_size 8192, no_rope_layers au motif [1,1,1,0] (soit
12 couches NoPE sur 48), attn_temperature_tuning: true, floor_scale 8192,
attn_scale 0,1, 16 experts avec 1 seul activé par token,
max_position_embeddings 10 485 760.
C'est exactement le type de fichier qui n'existe pas pour Pokee-Isaac, et c'est ce qui rend les calculs sur Scout indépendants de toute hypothèse.
Documentation Llama4 — Hugging Face Transformers¶
Soutient la description officielle de attn_temperature_tuning (« dynamically
scale the attention temperature for each query token based on sequence length »)
et de floor_scale, ainsi que leurs valeurs par défaut.
Hugging Face — Welcome Llama 4 Maverick & Scout¶
Soutient : l'explication d'iRoPE ; le fait que le temperature scaling s'applique aux couches NoPE et non aux couches RoPE ; que le chunked attention limite les couches RoPE à des blocs de 8 192 tokens tandis que « les couches NoPE conservent l'accès au contexte complet » ; l'entraînement sur jusqu'à 40 000 milliards de tokens en 200 langues.
Code de référence — modeling_llama4.py¶
Soutient la formule exacte du temperature tuning :
attn_scales = log(floor((positions + 1) / floor_scale) + 1) * attn_scale + 1,
appliquée aux query_states.
Évaluations et analyses indépendantes de Llama 4 Scout¶
- Composio — Notes on Llama 4: The Hits, the Misses, and the Disasters — dégradation observée au-delà de ≈ 120 K tokens ; controverse LMArena sur la soumission d'une version « expérimentale » différente du modèle publié.
- promptinjection.net — Llama 4 Scout: Total Disaster or Misunderstood Workhorse?
- Tech Jacks Solutions — LLMs by context window: advertised vs usable — contexte effectif estimé nettement inférieur à la fenêtre annoncée.
- BenchmarkList — fiction.liveBench — le benchmark d'où provient le chiffre de 15,6 %.
Attribution du chiffre de 15,6 %
Plusieurs reprises secondaires attribuent par erreur ce score à RULER. La mesure provient de fiction.liveBench, à 128 K tokens, où Llama 4 Scout obtient 15,6 % contre 90,6 % pour Gemini 2.5 Pro.
Ce rapport retient l'attribution à fiction.liveBench, confirmée par plusieurs sources concordantes.
Sources de la partie Prospective¶
Ces travaux fondent la partie Prospective. Ils sont tous publics, avec code ouvert pour la plupart. Chacun est présenté en détail, avec ce qu'il démontre et où il s'arrête, au chapitre Prospective · 03.
Encodeur parallèle et attention croisée
- CEPE — Long-Context Language Modeling with Parallel Context Encoding
— Yen, Gao, Chen (Princeton), ACL 2024,
arXiv:2402.16617, code - YOCO — You Only Cache Once — Microsoft
Research et Tsinghua, NeurIPS 2024,
arXiv:2405.05254 - On The Adaptation of Unlimiformer for Decoder-Only Transformers
—
arXiv:2410.01637
Compression en tokens de mémoire
- Learning to Compress Prompts with Gist Tokens
— Mu, Li, Goodman (Stanford), NeurIPS 2023,
arXiv:2304.08467 - Adapting Language Models to Compress Contexts
— Chevalier, Wettig, Ajith, Chen (Princeton), EMNLP 2023,
arXiv:2305.14788, code - In-context Autoencoder (ICAE) — Ge et al.,
arXiv:2307.06945, code - Long Context Compression with Activation Beacon
— ICLR 2025,
arXiv:2401.03462
Mémoire compressive et sélection
- Leave No Context Behind: Infini-attention
— Google, 2024,
arXiv:2404.07143 - Native Sparse Attention (NSA) — DeepSeek,
ACL 2025,
arXiv:2502.11089 - Cartridges: long context representations via self-study
— Eyuboglu et al. (Stanford), 2025,
arXiv:2506.06266, code
Ce que ces sources ne soutiennent pas
Aucun de ces travaux ne porte sur Pokee-Isaac, et aucun n'a été publié à 10 M de tokens — CEPE plafonne à 128 K, YOCO à 1 M, NSA à 64 K.
Ils démontrent que les briques fonctionnent séparément. Ils ne démontrent pas que l'assemblage proposé fonctionnerait, ni qu'il correspond à ce que fait Isaac.
Sources de référence — arrière-plan technique¶
Ces sources n'ont pas été utilisées pour affirmer quoi que ce soit sur Isaac. Elles fondent la partie Fondations et les familles d'architectures du chapitre 03.
- RULER — Hsieh et al., NVIDIA, 2024. Le benchmark de contexte long employé par Pokee.
- MRCR — Google DeepMind. Benchmark de résolution de coréférences multi-tours.
- BFCL — UC Berkeley. Classement d'appel de fonctions.
- Littérature sur les architectures hybrides et la linéarisation : Jamba (AI21), MiniMax-01, Qwen3-Next, Kimi Linear (Moonshot), Granite 4 (IBM), Nemotron-H (NVIDIA), Mamba-in-Llama, LoLCATs, MOHAWK.
- Analyse de Kimi K3 publiée dans cette bibliothèque — point de comparaison pour une architecture hybride entièrement documentée.
Sources recherchées et introuvables¶
Par transparence, ce qui a été cherché sans succès :
| Recherche | Résultat |
|---|---|
Rapport technique à console.pokee.ai/pokee-isaac-28 |
HTTP 404 |
| Papier arXiv sur Isaac ou Pokee | Aucun |
| Poids sur Hugging Face | Aucun |
Fichier config.json |
Aucun |
| Discussion technique sur Reddit / Hacker News | Aucune trouvée |
| Évaluation indépendante | Aucune |
| Demandes de brevet publiées | Aucune (provisoires, non publiables) |
Le fait le plus important de cette annexe
L'URL du « rapport technique » citée par plusieurs sources secondaires
(console.pokee.ai/pokee-isaac-28) renvoie une erreur 404. La seule page
« rapport » accessible est un tableau de benchmarks.
Il n'existe pas, au 6 août 2026, de rapport technique public sur Pokee-Isaac 28B. C'est ce qui justifie la méthode employée dans ce rapport.
Note sur la fraîcheur¶
Ce rapport a été rédigé deux jours après l'annonce. C'est trop tôt pour qu'une évaluation indépendante existe, et trop tôt pour qu'une intégration dans vLLM ou SGLang soit visible.
Il devra être réédité si :
- une évaluation indépendante paraît ;
- Pokee publie un vrai rapport technique ;
- du code d'intégration apparaît dans vLLM ou SGLang ;
- les demandes de brevet sont publiées (mi-2027 au plus tôt).