Aller au contenu

Sources

Toutes les sources consultées pour ce rapport, avec ce que chacune soutient réellement.

Date de consultation : 6 août 2026.


Sources primaires — Pokee AI

Ce sont les seules sources de première main. Elles sont toutes commerciales.

console.pokee.ai/model

Page « rapport détaillé » officielle. Soutient : les scores RULER (256 K à 10 M), MRCR, BFCL v4, τ³-bench, Terminal-Bench, MCP-Atlas, DTAP ; le panel de comparaison et ses prix ; la mention « texte seul » ; l'aveu que les défenses de sécurité sont « essentiellement incidentelles » et que trois modèles du panel ne peuvent pas être achetés aux longueurs comparées.

Ce qu'elle ne contient pas

Malgré son titre, cette page ne contient aucune information architecturale ni aucun détail d'entraînement. C'est un tableau de benchmarks et de prix.

pokee.ai

Site principal. Soutient : « ~5× KV cache / same VRAM » ; « reinforcement-learned across nine enterprise verticals » ; « five provisional patents on long-context model design » ; la distinction modèle / harness d'agent (Plan · Act · Verify · Cite, 90+ outils) ; les modes de déploiement.

Annonce sur X — @Pokee_AI

Annonce d'origine du 4 août 2026. Soutient le texte exact des revendications.

Note d'accès

Cette page n'a pas pu être récupérée directement lors de la rédaction (X restreint l'accès automatisé). Le contenu du message a été reconstitué à partir du post LinkedIn identique du fondateur et de plusieurs reprises concordantes.

Annonce du fondateur sur LinkedIn

Version LinkedIn de l'annonce, par Zheqing (Bill) Zhu. Soutient : le texte complet de l'annonce ; « new proprietary non-decoder-only architecture » ; la mention de l'affinage partiel depuis Qwen3.6-27B ; les commentaires de la communauté sur la qualité de l'attention et la sélection de contexte.


Sources secondaires — agrégateurs et fiches techniques

BenchLM.ai — fiche Pokee-Isaac 28B

Agrégateur de benchmarks. Soutient : le composite agentique de 50,9/100 et le rang 46ᵉ sur 132 ; le prix mixte de 0,57 $/M ; MRCR v2 à 60,7 % ; MCP-Atlas à 74,6 ; PinchBench à 95,7 ; la mention que le modèle « ne se qualifie pas pour un classement général public ».

Ce que BenchLM est et n'est pas

BenchLM agrège des scores publiés, il ne les reproduit pas. Ce n'est donc pas une évaluation indépendante — c'est une mise en perspective dans un référentiel commun. C'est utile, et différent.

BenchLM.ai — statistiques des fenêtres de contexte

Soutient : au 5 août 2026, la plus grande fenêtre de contexte suivie par BenchLM est celle de Pokee-Isaac 28B, à 10 M de tokens.

NanoGPT — fiche Pokee-Isaac

Revendeur d'API. Soutient : la sortie maximale de 60 000 tokens ; les prix revendeur (0,16 $ / 1,05 $ / 0,079 $ en cache) ; la politique de conservation des données (aperçu de 120 caractères 1 jour, charges chiffrées 7 jours) ; la date d'ajout du 4 août 2026.

C'est la source la plus utile pour le tarif de lecture en cache, que Pokee ne publie pas.


Sources de contexte — presse

KuCoin News — Pokee AI Launches 28B-Parameter Model with 10M Token Context Window

Soutient : la fondation en 2024 ; le parcours de Zhu Zheqing (ancien responsable de l'apprentissage par renforcement appliqué chez Meta) ; le tour d'amorçage de 12 M$ mené par Point72 Ventures avec Qualcomm Ventures et Samsung NEXT ; le fait que le rapport technique ne divulgue ni le mécanisme d'attention ni le schéma de gestion mémoire.

explainx.ai — Pokee-Isaac 28B: 10M-Token Context on One GPU

Analyse secondaire. Soutient : l'identification du cache clé-valeur comme obstacle mécanique central ; la mention que « le mécanisme profond vit dans le rapport technique de Pokee » — c'est-à-dire nulle part de public ; la qualification explicite de tous les chiffres comme « résumé de benchmarks internes, non vérifiés indépendamment ».

Utilité et limite

Cette source pose correctement le problème technique, mais ne dispose d'aucune information que Pokee n'ait publiée. Elle ne peut donc pas répondre à la question de l'architecture, et le dit.


Sources sur le précédent Llama 4 Scout

Ces sources fondent le chapitre Fondations · 05.

Meta AI — The Llama 4 herd

Source primaire. Soutient : Llama 4 Scout à 17 G actifs / 109 G totaux, 16 experts ; la fenêtre annoncée de 10 M de tokens ; l'architecture iRoPE ; et surtout la déclaration que le modèle est « pré-entraîné et post-entraîné avec une longueur de 256 K » — donc que les 10 M relèvent de l'extrapolation.

Soutient également que les seules évaluations de contexte long publiées par Meta sont l'aiguille dans une botte de foin et la vraisemblance négative cumulée sur 10 M de tokens de code.

config.json de Llama 4 Scout

Source primaire, et la plus utile de toute cette annexe. Soutient toutes les valeurs architecturales employées dans les calculs sur Scout : 48 couches, hidden_size 5120, 40 têtes de requête, 8 têtes clé/valeur, head_dim 128, attention_chunk_size 8192, no_rope_layers au motif [1,1,1,0] (soit 12 couches NoPE sur 48), attn_temperature_tuning: true, floor_scale 8192, attn_scale 0,1, 16 experts avec 1 seul activé par token, max_position_embeddings 10 485 760.

C'est exactement le type de fichier qui n'existe pas pour Pokee-Isaac, et c'est ce qui rend les calculs sur Scout indépendants de toute hypothèse.

Documentation Llama4 — Hugging Face Transformers

Soutient la description officielle de attn_temperature_tuning (« dynamically scale the attention temperature for each query token based on sequence length ») et de floor_scale, ainsi que leurs valeurs par défaut.

Hugging Face — Welcome Llama 4 Maverick & Scout

Soutient : l'explication d'iRoPE ; le fait que le temperature scaling s'applique aux couches NoPE et non aux couches RoPE ; que le chunked attention limite les couches RoPE à des blocs de 8 192 tokens tandis que « les couches NoPE conservent l'accès au contexte complet » ; l'entraînement sur jusqu'à 40 000 milliards de tokens en 200 langues.

Code de référence — modeling_llama4.py

Soutient la formule exacte du temperature tuning : attn_scales = log(floor((positions + 1) / floor_scale) + 1) * attn_scale + 1, appliquée aux query_states.

Évaluations et analyses indépendantes de Llama 4 Scout

Attribution du chiffre de 15,6 %

Plusieurs reprises secondaires attribuent par erreur ce score à RULER. La mesure provient de fiction.liveBench, à 128 K tokens, où Llama 4 Scout obtient 15,6 % contre 90,6 % pour Gemini 2.5 Pro.

Ce rapport retient l'attribution à fiction.liveBench, confirmée par plusieurs sources concordantes.


Sources de la partie Prospective

Ces travaux fondent la partie Prospective. Ils sont tous publics, avec code ouvert pour la plupart. Chacun est présenté en détail, avec ce qu'il démontre et où il s'arrête, au chapitre Prospective · 03.

Encodeur parallèle et attention croisée

Compression en tokens de mémoire

Mémoire compressive et sélection

Ce que ces sources ne soutiennent pas

Aucun de ces travaux ne porte sur Pokee-Isaac, et aucun n'a été publié à 10 M de tokens — CEPE plafonne à 128 K, YOCO à 1 M, NSA à 64 K.

Ils démontrent que les briques fonctionnent séparément. Ils ne démontrent pas que l'assemblage proposé fonctionnerait, ni qu'il correspond à ce que fait Isaac.


Sources de référence — arrière-plan technique

Ces sources n'ont pas été utilisées pour affirmer quoi que ce soit sur Isaac. Elles fondent la partie Fondations et les familles d'architectures du chapitre 03.

  • RULER — Hsieh et al., NVIDIA, 2024. Le benchmark de contexte long employé par Pokee.
  • MRCR — Google DeepMind. Benchmark de résolution de coréférences multi-tours.
  • BFCL — UC Berkeley. Classement d'appel de fonctions.
  • Littérature sur les architectures hybrides et la linéarisation : Jamba (AI21), MiniMax-01, Qwen3-Next, Kimi Linear (Moonshot), Granite 4 (IBM), Nemotron-H (NVIDIA), Mamba-in-Llama, LoLCATs, MOHAWK.
  • Analyse de Kimi K3 publiée dans cette bibliothèque — point de comparaison pour une architecture hybride entièrement documentée.

Sources recherchées et introuvables

Par transparence, ce qui a été cherché sans succès :

Recherche Résultat
Rapport technique à console.pokee.ai/pokee-isaac-28 HTTP 404
Papier arXiv sur Isaac ou Pokee Aucun
Poids sur Hugging Face Aucun
Fichier config.json Aucun
Discussion technique sur Reddit / Hacker News Aucune trouvée
Évaluation indépendante Aucune
Demandes de brevet publiées Aucune (provisoires, non publiables)

Le fait le plus important de cette annexe

L'URL du « rapport technique » citée par plusieurs sources secondaires (console.pokee.ai/pokee-isaac-28) renvoie une erreur 404. La seule page « rapport » accessible est un tableau de benchmarks.

Il n'existe pas, au 6 août 2026, de rapport technique public sur Pokee-Isaac 28B. C'est ce qui justifie la méthode employée dans ce rapport.


Note sur la fraîcheur

Ce rapport a été rédigé deux jours après l'annonce. C'est trop tôt pour qu'une évaluation indépendante existe, et trop tôt pour qu'une intégration dans vLLM ou SGLang soit visible.

Il devra être réédité si :

  • une évaluation indépendante paraît ;
  • Pokee publie un vrai rapport technique ;
  • du code d'intégration apparaît dans vLLM ou SGLang ;
  • les demandes de brevet sont publiées (mi-2027 au plus tôt).