Lecture critique des évaluations¶
Cinq points d'attention, du plus important au plus mineur.
1. Les « 0,0 » des concurrents ne sont pas des échecs¶
C'est l'argument central de la communication de Pokee :
All 5 competitors scored 0.0 past 2M tokens.
Il faut le lire précisément.
Un zéro peut signifier trois choses très différentes
| Cause du zéro | Ce que cela mesure |
|---|---|
| Le modèle refuse l'entrée (dépassement de fenêtre) | Rien sur sa qualité |
| Le modèle plante (mémoire insuffisante) | Une limite d'infrastructure |
| Le modèle répond faux | Une vraie défaillance de rappel |
Or les modèles du panel — GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super, Qwen 3.5 122B — ont des fenêtres annoncées très inférieures à 2 M de tokens. Leur zéro relève donc du premier cas.
Pokee l'admet d'ailleurs indirectement en notant que « trois des modèles du panel affichent un tarif mais ne peuvent pas être achetés à ces longueurs de contexte ».
La formulation correcte serait : « Isaac est le seul modèle du panel qui accepte 2 M de tokens. » C'est un fait, et c'est différent de « les autres échouent ».
Cela ne retire rien au mérite d'accepter 10 M — mais transforme un graphique apparemment écrasant en une simple constatation de disponibilité.
Et le panel omet le seul modèle qui aurait pu répondre
Llama 4 Scout (Meta, avril 2025) annonce lui aussi 10 M de tokens et accepte donc les longueurs testées. Il ne figure pas dans le panel de Pokee.
C'est ce qui rend le « 0,0 pour tous les autres » possible. Avec Scout dans le tableau, la colonne « au-delà de 2 M » n'aurait pas été vide — elle aurait contenu un chiffre faible, ce qui est un message différent de l'absence totale de concurrence.
Voir Fondations · 05 pour les deux lectures possibles de cette omission.
2. RULER à 10 M n'est pas un protocole standardisé¶
RULER est un générateur de tâches synthétiques : on choisit une longueur, on fabrique un remplissage, on y insère des aiguilles, on interroge. Les configurations publiées par les auteurs s'arrêtent bien en dessous de 10 M.
Aller à 10 M suppose de fabriquer soi-même la botte de foin. Et la nature du remplissage change radicalement la difficulté :
| Remplissage | Difficulté |
|---|---|
| Texte répété ou peu varié | Très faible — l'aiguille est trivialement distinctive |
| Documents naturels variés et denses | Élevée — l'aiguille se noie dans du contenu pertinent |
| Contenu adversarial (quasi-doublons) | Très élevée — c'est ce que mesure MRCR |
Ce qu'il faudrait savoir, et qu'on ne sait pas
- De quoi est fait le remplissage à 10 M ?
- Combien d'aiguilles, à quelles positions ?
- Quelles catégories de RULER sont incluses ? Les catégories tracing et aggregation, qui exigent réellement de traverser tout le contexte, sont-elles évaluées à 10 M ou seulement le retrieval ?
Sans ces informations, 93,3 n'est pas comparable à un score RULER publié par quiconque d'autre. C'est un chiffre interne à Pokee, sur un protocole interne à Pokee.
3. Le meilleur indicateur est l'écart RULER / MRCR¶
Plutôt que de discuter le 93,3, regardons ce que Pokee publie à longueur égale :
| 512 K | |
|---|---|
| RULER | 96,7 |
| MRCR v2 | 74,3 |
22 points d'écart. Et c'est Pokee qui publie les deux.
L'estimation honnête pour 10 M
Si l'écart se maintient proportionnellement, la performance réelle d'Isaac à 10 M sur une tâche exigeant de la discrimination fine serait de l'ordre de 65 à 75, et non de 93.
Ce n'est pas un mauvais résultat — c'est probablement un très bon résultat à cette longueur. Mais c'est le chiffre à retenir pour un usage réel, pas le 93,3.
Le fait que Pokee publie le MRCR est d'ailleurs à mettre à son crédit : beaucoup se contenteraient du chiffre flatteur. Meta, pour Llama 4 Scout, n'avait publié que l'aiguille dans la botte de foin — il a fallu des tiers pour découvrir les 15,6 % à 128 K.
4. Modèle nu ou système complet ?¶
Isaac est livré avec un harness d'agent implémentant une boucle Plan · Act · Verify · Cite et intégrant plus de 90 outils.
Les benchmarks agentiques — BFCL v4, τ³-bench, MCP-Atlas, Terminal-Bench — mesurent un système, pas un modèle. Une boucle de vérification bien conçue peut valoir plusieurs points sans que le modèle change.
La question sans réponse
Isaac a-t-il été évalué avec son harness ? Les concurrents ont-ils été évalués avec un harness équivalent, ou nus ?
Rien dans la communication de Pokee ne permet de le savoir. Sur BFCL v4, où l'écart avec GPT-5.6 Luna est de 0,33 point, cette seule question suffit à rendre le classement indécidable.
5. Les catégories absentes¶
| Capacité | Évaluée ? |
|---|---|
| Contexte long | Oui |
| Usage d'outils | Oui |
| Terminal | Oui |
| Sécurité | Oui (partiellement, garde-fous inactifs) |
| Connaissances générales | Non |
| Mathématiques | Non |
| Multilingue | Non |
| Suivi d'instructions | Non |
| Code hors terminal | Non |
| Multimodal | Sans objet (texte seul) |
Lecture équitable de ces absences
Un modèle de 28 milliards de paramètres, partiellement converti depuis un modèle de base et post-entraîné sur des tâches agentiques, n'a vraisemblablement pas de performances remarquables en mathématiques ou en connaissances générales. Ne pas les publier est un choix commercial normal.
Mais cela invalide l'étiquette « classe frontière » : un modèle de classe frontière est fort partout. Isaac est, sur la base des données disponibles, un modèle spécialisé — bon dans sa niche, non mesuré ailleurs.
C'est d'ailleurs un positionnement défendable et probablement plus utile commercialement. L'étiquette est le problème, pas le modèle.
Synthèse¶
Ce qu'on peut raisonnablement conclure des évaluations
- Isaac accepte 10 M de tokens là où aucun concurrent de sa classe ne dépasse le million. C'est établi et significatif.
- Sa dégradation avec la longueur est faible, ce qui est la signature d'une architecture réellement conçue pour cela.
- Sur les tâches exigeant de la discrimination fine, attendre 65-75 plutôt que 93.
- Sur l'usage d'outils, il est au niveau des bons modèles économiques, pas devant eux.
- Sur tout le reste, on ne sait pas.
- Rien n'a été vérifié indépendamment.
Ce qu'il faudrait pour trancher
Une évaluation par un tiers, sur un protocole publié, avec les concurrents dans leurs conditions optimales. Cela n'existait pas au 6 août 2026 — deux jours après l'annonce, ce qui est normal.
Ce rapport devra être réédité dès que de telles évaluations apparaîtront.