Les résultats annoncés¶
Tous les chiffres de ce chapitre proviennent de la page de comparaison publiée par Pokee AI (console.pokee.ai/model) et de l'annonce du 4 août 2026.
Le panel de comparaison¶
Pokee compare Isaac à cinq modèles :
| Modèle | Éditeur | Prix d'entrée |
|---|---|---|
| Pokee-Isaac 28B | Pokee AI | 0,15 $/M |
| GPT-5.6 Luna | OpenAI | 0,40 $/M |
| Gemini 3.5 Flash Lite | 0,30 $/M | |
| Claude Haiku 4.5 | Anthropic | 1,00 $/M |
| Nemotron 3 Super | NVIDIA | 0,15 $/M |
| Qwen 3.5 122B | Alibaba | 0,26 $/M |
La nature du panel
Ce sont tous des modèles de la classe rapide et économique de leurs éditeurs respectifs, pas leurs modèles phares. Le panel est cohérent avec le positionnement d'Isaac (28 milliards de paramètres, 0,15 $/M), et il est normal qu'un éditeur se compare à sa classe de prix.
Cela signifie simplement que « devant tous les modèles comparés » ne veut pas dire « devant l'état de l'art ».
Contexte long — RULER¶
| Longueur | Score Isaac |
|---|---|
| 256 K | 96,9 |
| 512 K | 96,7 |
| 1 M | 95,0 |
| 2 M | 95,8 |
| 4 M | ≈ 95 |
| 10 M | 93,3 |
Pokee indique que les cinq modèles du panel « tombent à 0,0 » à partir de 2 M de tokens. Ce point demande une lecture attentive : voir chapitre suivant.
Ce qui est remarquable, si le chiffre est exact
La quasi-absence de dégradation entre 256 K et 10 M — 3,6 points sur un facteur 40 en longueur — est le vrai résultat annoncé. La plupart des modèles perdent 10 à 30 points sur un facteur 4.
C'est la signature attendue d'une architecture dont le mécanisme de récupération ne dépend pas de la longueur : soit une sélection de blocs, soit un état de taille fixe. Voir Architecture · 04.
Contexte long — MRCR v2¶
| Modèle | MRCR @ 512 K |
|---|---|
| Pokee-Isaac 28B | 0,743 |
| Gemini 3.5 Flash Lite | ≈ 0,19 (« 4× moins bon ») |
BenchLM rapporte par ailleurs un score MRCR v2 de 60,7 % pour Isaac, sans préciser la longueur — probablement une moyenne sur plusieurs longueurs, ou un protocole différent.
L'écart RULER / MRCR est le chiffre le plus instructif du lot
À longueur identique (512 K) :
| Benchmark | Score |
|---|---|
| RULER | 96,7 |
| MRCR v2 | 74,3 |
Plus de 22 points d'écart. Ce n'est pas une anomalie : MRCR exige de distinguer des éléments quasi identiques, ce que la similarité sémantique ne permet pas.
Cet écart est cohérent avec un mécanisme de récupération fondé sur la similarité — attention creuse sélective, mémoire compressée — qui excelle à retrouver ce qui est distinctif et peine à distinguer ce qui se ressemble.
Il donne aussi la mesure réaliste de ce qu'il faut attendre à 10 M : le 93,3 de RULER est un plafond optimiste, pas une garantie de fidélité.
Capacités agentiques¶
| Benchmark | Isaac | Meilleur concurrent du panel |
|---|---|---|
| BFCL v4 (appel de fonctions) | 70,94 | GPT-5.6 Luna : 70,61 |
| τ³-bench (multi-tours) | 0,662 | non détaillé |
| Terminal-Bench 2.1 | 65,1 % | 2ᵉ place |
| MCP-Atlas | 74,6 | non détaillé |
| PinchBench | 95,7 | non détaillé |
Autres scores BFCL v4 du panel : Claude Haiku 4.5 à 67,52 ; Qwen 3.5 122B à 64,88 ; Gemini 3.5 Flash Lite à 64,85 ; Nemotron 3 Super à 33,13.
Lire l'écart de 0,33 point sur BFCL
70,94 contre 70,61 : l'écart est de 0,33 point, soit 0,5 % relatif. Sur un benchmark de quelques centaines à quelques milliers de cas, c'est largement dans le bruit d'échantillonnage et de configuration.
« Devant BFCL v4 » est vrai au sens strict et sans signification pratique. Le résultat honnête est : Isaac est au niveau de GPT-5.6 Luna sur l'appel d'outils, pour un tiers du prix. C'est déjà un bon résultat.
Terminal-Bench 2.1 est le score le plus significatif du tableau : il est vérifié par exécution réelle de tâches dans un terminal, donc non devinable. 65,1 % pour un modèle de 28 milliards de paramètres est solide — et Isaac y est deuxième, pas premier.
Sécurité — DTAP¶
| Métrique | Isaac |
|---|---|
| Taux de succès d'attaque | 35,6 (le plus bas du panel) |
| Refus explicites sur tâches malveillantes | 1,5 % |
Le bon score ne mesure pas ce qu'on croit
Pokee précise elle-même que ses défenses actuelles sont « essentiellement incidentelles plutôt que délibérées » et que la mesure est effectuée « garde-fous inactifs ».
Autrement dit : Isaac résiste à 64 % des attaques non pas parce qu'il refuse, mais parce qu'il échoue à les exécuter — par incapacité, maladresse ou dérive de tâche. Ce n'est pas de la sécurité, c'est de l'incompétence protectrice, et elle disparaîtra à mesure que le modèle s'améliorera.
Pour un déploiement sur site avec accès à des outils réels, la couche de refus reste entièrement à construire par l'intégrateur.
Efficacité¶
| Métrique | Valeur |
|---|---|
| Préfill à 10 M sur 1× B200 | jusqu'à 137 200 tokens/s |
| Cache clé-valeur | ≈ 5× à VRAM égale |
| Matériel minimal annoncé | RTX 4090, Intel Arc Pro B70, NPU Qualcomm |
Ce qui manque au tableau d'efficacité
Seul le préfill est publié. Ne le sont pas :
- la latence au premier token — combien de temps avant que la réponse commence, à 10 M de tokens ? (73 secondes de préfill au minimum) ;
- le débit de génération — combien de tokens par seconde en sortie, une fois le contexte chargé ? C'est ce qui détermine l'expérience réelle ;
- le débit sous charge — avec plusieurs requêtes simultanées, ce qui est la seule mesure pertinente pour un service.
Un modèle qui lit 10 M de tokens en 73 secondes puis génère à 5 tokens/s serait inutilisable. Rien ne permet d'écarter ce scénario.
Classement indépendant (BenchLM)¶
Le seul agrégateur tiers ayant référencé le modèle au 6 août 2026 :
| Catégorie | Score | Rang |
|---|---|---|
| Agentique | 50,9 / 100 | 46ᵉ sur 132 |
| Raisonnement | 48,2 | non classé |
| Code | en attente | non classé |
| Connaissances, mathématiques, multilingue, multimodal, suivi d'instructions | aucune donnée | — |
BenchLM note que le modèle « ne se qualifie pas pour un classement général public » faute de couverture suffisante, tout en relevant sa force particulière « sur les tâches informatiques et l'usage agentique d'outils ».
Précision importante
BenchLM agrège des scores publiés, il ne les reproduit pas. Ce classement n'est donc pas une évaluation indépendante — c'est une mise en perspective des chiffres de Pokee dans un référentiel commun.
Il n'en est pas moins utile : il montre qu'une fois replacés parmi 132 modèles, les chiffres d'Isaac situent le modèle au milieu de tableau en agentique, et non « en classe frontière ».
Chapitre suivant : Lecture critique