Aller au contenu

Ce qui n'est pas publié

Un inventaire des absences est aussi informatif qu'un inventaire des faits : chaque absence indique une conclusion qu'on ne peut pas tirer.


Le tableau des absences

Information Publiée ? Ce que son absence empêche
Volume de tokens d'entraînement Non Estimer la qualité du modèle par les lois d'échelle
Composition des données Non Évaluer les biais, la couverture linguistique, la contamination
Budget de calcul (GPU-heures) Non Situer l'effort face à la concurrence
Procédure d'extension du contexte Non Comprendre comment 10 M est atteint
Longueur des séquences d'entraînement Non Savoir si le modèle a vu 10 M ou seulement extrapolé
Encodage de position Non Déduire le comportement en extrapolation
Méthode de RL Non Juger la robustesse hors distribution
Nombre et nature des environnements RL Non Estimer le recouvrement avec les benchmarks
Données de sécurité et d'alignement Non Anticiper le comportement en déploiement
Modèle professeur éventuel Non Savoir si Isaac distille un modèle plus grand
Contamination des benchmarks Non Interpréter les scores

L'absence la plus critique : la longueur d'entraînement

La question centrale non résolue

Un modèle peut traiter 10 M de tokens sans avoir jamais été entraîné sur 10 M de tokens. La différence est décisive.

  • Entraînement direct à longue portée : le modèle a vu des séquences de plusieurs millions de tokens et a appris à y naviguer. Coûteux — l'infrastructure nécessaire (parallélisme de contexte) est un projet en soi.
  • Extrapolation : le modèle est entraîné sur des séquences bien plus courtes (128 K, 512 K), et son architecture lui permet de continuer à fonctionner au-delà. C'est une propriété naturelle des couches à état de taille fixe, dont le comportement ne dépend pas explicitement de la position.

Les architectures récurrentes extrapolent structurellement : rien dans leur calcul ne change entre le token 500 000 et le token 9 000 000. Il est donc tout à fait possible qu'Isaac n'ait jamais vu 10 M de tokens à l'entraînement.

Le précédent est documenté, et il est mauvais

Ce n'est pas une inquiétude théorique. Llama 4 Scout a été annoncé en avril 2025 avec 10 M de tokens, alors que Meta déclare l'avoir pré-entraîné et post-entraîné à 256 K — soit une extrapolation d'un facteur 39.

Résultat mesuré par des tiers : effondrement à 15,6 % sur un test de compréhension à 128 K, et un contexte réellement exploitable estimé bien en deçà des 10 M annoncés.

Meta, au moins, publiait sa longueur d'entraînement. Pokee ne la publie pas — on ne peut donc même pas calculer le facteur d'extrapolation d'Isaac.

Analyse complète : Fondations · 05.

Pourquoi cela compte pour l'utilisateur. Un modèle qui extrapole peut parfaitement réussir des tâches synthétiques de type RULER — où le remplissage est ignorable et la structure simple — et échouer sur du contenu réel dense à la même longueur, faute d'avoir jamais appris à gérer une telle accumulation d'information pertinente.

C'est peut-être l'explication de l'écart observé entre RULER (96,7 à 512 K) et MRCR (74,3 à la même longueur). Voir Évaluations · 02.


L'absence la plus banale : la contamination

Aucun laboratoire ne publie sérieusement d'analyse de contamination, et Pokee ne fait pas exception. Mais le risque est ici structurel plutôt qu'accidentel :

  • Isaac est entraîné par renforcement sur neuf verticales d'entreprise.
  • Il est évalué sur des benchmarks d'usage d'outils dans des domaines d'entreprise (τ³-bench simule notamment la vente au détail et le transport aérien).

Ce n'est pas une accusation, c'est une question sans réponse

Si les environnements d'entraînement recouvrent les domaines d'évaluation, les scores mesurent une capacité spécialisée, non une capacité générale — ce qui est parfaitement légitime pour un produit d'entreprise, mais ne justifie pas de comparer les scores à ceux de modèles généralistes évalués à froid.

Sans la liste des environnements, la question reste ouverte.


Ce qu'un rapport technique complet aurait contenu

À titre de comparaison, l'analyse de Kimi K3 publiée dans cette bibliothèque documente, pour un modèle sorti une semaine plus tôt : les données de pré-entraînement, les lois d'échelle employées, la recette de pré-entraînement, la procédure d'extension du contexte à 1 M, le SFT, la méthode de RL, la distillation multi-professeurs, les environnements RL et la quantification — soit dix chapitres, tous adossés à des sources primaires.

Pour Isaac, le rapport correspondant tiendrait en deux paragraphes, et ce sont ceux du chapitre précédent.

Ce n'est pas un jugement moral

Publier ses recettes est un choix stratégique, pas une obligation. Un laboratoire qui vend une API et des licences sur site n'a aucun intérêt évident à documenter son avantage technique — d'où les brevets.

Mais cela a une conséquence directe et neutre : les affirmations de Pokee doivent être traitées comme des affirmations commerciales tant qu'aucune évaluation indépendante n'existe. C'est l'objet de la partie Analyse critique.