Aller au contenu

Ce qui est connu

Quatre éléments, pas un de plus.


1. Une base héritée : Qwen3.6-27B

While some weights are fine-tuned from Qwen3.6-27B under Apache 2.0, Isaac is not a conventional Qwen fine-tune and other weights of Isaac are trained from scratch by the Pokee AI team.

C'est la déclaration la plus informative de toute la communication de Pokee. Elle contient trois affirmations distinctes.

« Certains poids sont affinés depuis Qwen3.6-27B »

Qwen3.6-27B est un modèle publié par Alibaba sous licence Apache 2.0, qui autorise explicitement la réutilisation commerciale et la production de modèles dérivés fermés. L'usage est donc légitime, et la mention est probablement une obligation d'attribution.

Ce que cela implique techniquement : les poids hérités conservent la forme de Qwen. Même dimension de modèle, même dimension des réseaux à propagation avant, très probablement même vocabulaire et même tokeniseur.

C'est ce qui justifie les hypothèses de forme employées dans la partie Architecture.

« Isaac n'est pas un fine-tune conventionnel de Qwen »

Formule prudente et, à la lecture de l'arithmétique, exacte. Un modèle dont la plupart des couches de mélange sont d'une nature différente de celles de Qwen n'est effectivement pas un simple affinage.

« D'autres poids sont entraînés de zéro »

Lesquels ? La réponse logique découle du reste : ce sont les couches sans équivalent dans Qwen, c'est-à-dire précisément le mécanisme de mélange de tokens — attention linéaire, état récurrent, ou encodeur de contexte. Rien à hériter, donc entraînement de zéro.

La méthode reconstruite : la conversion d'architecture

Cette combinaison — garder les réseaux à propagation avant d'un modèle existant, remplacer et ré-entraîner les couches de mélange — porte un nom dans la littérature : linéarisation ou distillation d'architecture (familles Mamba-in-Llama, LoLCATs, MOHAWK, Liger).

Le principe : les réseaux à propagation avant contiennent l'essentiel des connaissances et l'essentiel des paramètres ; les couches de mélange contiennent le mécanisme. On peut donc changer le mécanisme en préservant les connaissances.

Le gain est spectaculaire : la littérature publique rapporte des conversions réussies pour l'équivalent de quelques milliards à quelques dizaines de milliards de tokens d'entraînement — soit 0,1 % à 1 % du coût d'un pré-entraînement complet (de l'ordre de \(10^{13}\) tokens).

Pourquoi cela explique le reste

Une start-up ayant levé 12 M$ ne peut pas pré-entraîner un modèle de 28 milliards de paramètres : cela coûterait plusieurs millions de dollars en calcul, sans compter les données et l'infrastructure.

Elle peut, en revanche, financer une conversion d'architecture sur un modèle ouvert de qualité, puis un post-entraînement par renforcement ciblé. C'est exactement ce que la déclaration de Pokee décrit, et c'est cohérent avec l'ensemble des indices.

Ce n'est en rien une critique : c'est une stratégie rationnelle et de plus en plus courante. Mais cela recadre la nature de l'accomplissement — la valeur ajoutée de Pokee est dans le mécanisme de contexte long et le post-entraînement agentique, pas dans le modèle de base.


2. Apprentissage par renforcement sur neuf verticales

Le site de Pokee indique que le modèle est « reinforcement-learned across nine enterprise verticals », dont sont nommées :

  • finance,
  • santé,
  • e-commerce,
  • éducation,
  • industrie manufacturière.

Les quatre autres ne sont pas listées publiquement.

Ce que cela signifie concrètement

Entraîner par renforcement sur une verticale suppose de construire des environnements : des simulations de tâches métier où les actions du modèle produisent des résultats vérifiables, et où l'on peut donc calculer une récompense.

C'est un travail d'ingénierie considérable — c'est d'ailleurs le principal poste d'effort des laboratoires d'agents en 2026. Le parcours du fondateur (direction de l'apprentissage par renforcement appliqué chez Meta AI) rend cette revendication crédible : c'est son domaine.

Ce qui n'est pas dit : la méthode (PPO, GRPO, DPO, autre chose), le nombre d'environnements, la nature des récompenses, le volume de trajectoires, la part de supervision humaine.

Conséquence pratique : les scores agentiques d'Isaac (BFCL v4, τ³-bench, MCP-Atlas) sont probablement le résultat direct de cet entraînement — ce qui pose la question habituelle du recouvrement entre les environnements d'entraînement et les domaines d'évaluation. Sans détails, cette question reste ouverte.


3. Le harness d'agent

Pokee distingue explicitement deux composants : le modèle (Long-Context Core) et le harness d'agent (Tool-Use Runtime), qui implémente une boucle Plan · Act · Verify · Cite et intègre plus de 90 outils.

Ce que le harness change dans la lecture des scores

Cela signifie qu'Isaac n'est pas vendu comme un modèle nu, mais comme un système. Les benchmarks agentiques mesurent le système complet.

Une partie des performances annoncées peut donc provenir de l'orchestration — planification, vérification, citation des sources — autant que du modèle. Rien n'indique dans quelle configuration les concurrents ont été mesurés.

L'étape « Cite » est notable : elle suggère que le modèle est entraîné à référencer les portions du contexte qu'il utilise. C'est un choix cohérent avec le long contexte — et un mécanisme qui, s'il repose sur une sélection de blocs, est un indice de plus en faveur d'un mécanisme de récupération interne (voir Architecture · 04).


4. Cinq brevets provisoires

Sur la « conception de modèles à long contexte ». Non publiés, non consultables avant mi-2027 au plus tôt.

Leur nombre suggère un ensemble de techniques combinées plutôt qu'une idée unique — cohérent avec l'hypothèse d'une architecture composite.


Chapitre suivant : Ce qui n'est pas publié