Aller au contenu

Les résultats annoncés

Tous les chiffres de ce chapitre proviennent de la page de comparaison publiée par Pokee AI (console.pokee.ai/model) et de l'annonce du 4 août 2026.


Le panel de comparaison

Pokee compare Isaac à cinq modèles :

Modèle Éditeur Prix d'entrée
Pokee-Isaac 28B Pokee AI 0,15 $/M
GPT-5.6 Luna OpenAI 0,40 $/M
Gemini 3.5 Flash Lite Google 0,30 $/M
Claude Haiku 4.5 Anthropic 1,00 $/M
Nemotron 3 Super NVIDIA 0,15 $/M
Qwen 3.5 122B Alibaba 0,26 $/M

La nature du panel

Ce sont tous des modèles de la classe rapide et économique de leurs éditeurs respectifs, pas leurs modèles phares. Le panel est cohérent avec le positionnement d'Isaac (28 milliards de paramètres, 0,15 $/M), et il est normal qu'un éditeur se compare à sa classe de prix.

Cela signifie simplement que « devant tous les modèles comparés » ne veut pas dire « devant l'état de l'art ».


Contexte long — RULER

Longueur Score Isaac
256 K 96,9
512 K 96,7
1 M 95,0
2 M 95,8
4 M ≈ 95
10 M 93,3

Pokee indique que les cinq modèles du panel « tombent à 0,0 » à partir de 2 M de tokens. Ce point demande une lecture attentive : voir chapitre suivant.

Ce qui est remarquable, si le chiffre est exact

La quasi-absence de dégradation entre 256 K et 10 M — 3,6 points sur un facteur 40 en longueur — est le vrai résultat annoncé. La plupart des modèles perdent 10 à 30 points sur un facteur 4.

C'est la signature attendue d'une architecture dont le mécanisme de récupération ne dépend pas de la longueur : soit une sélection de blocs, soit un état de taille fixe. Voir Architecture · 04.


Contexte long — MRCR v2

Modèle MRCR @ 512 K
Pokee-Isaac 28B 0,743
Gemini 3.5 Flash Lite ≈ 0,19 (« 4× moins bon »)

BenchLM rapporte par ailleurs un score MRCR v2 de 60,7 % pour Isaac, sans préciser la longueur — probablement une moyenne sur plusieurs longueurs, ou un protocole différent.

L'écart RULER / MRCR est le chiffre le plus instructif du lot

À longueur identique (512 K) :

Benchmark Score
RULER 96,7
MRCR v2 74,3

Plus de 22 points d'écart. Ce n'est pas une anomalie : MRCR exige de distinguer des éléments quasi identiques, ce que la similarité sémantique ne permet pas.

Cet écart est cohérent avec un mécanisme de récupération fondé sur la similarité — attention creuse sélective, mémoire compressée — qui excelle à retrouver ce qui est distinctif et peine à distinguer ce qui se ressemble.

Il donne aussi la mesure réaliste de ce qu'il faut attendre à 10 M : le 93,3 de RULER est un plafond optimiste, pas une garantie de fidélité.


Capacités agentiques

Benchmark Isaac Meilleur concurrent du panel
BFCL v4 (appel de fonctions) 70,94 GPT-5.6 Luna : 70,61
τ³-bench (multi-tours) 0,662 non détaillé
Terminal-Bench 2.1 65,1 % 2ᵉ place
MCP-Atlas 74,6 non détaillé
PinchBench 95,7 non détaillé

Autres scores BFCL v4 du panel : Claude Haiku 4.5 à 67,52 ; Qwen 3.5 122B à 64,88 ; Gemini 3.5 Flash Lite à 64,85 ; Nemotron 3 Super à 33,13.

Lire l'écart de 0,33 point sur BFCL

70,94 contre 70,61 : l'écart est de 0,33 point, soit 0,5 % relatif. Sur un benchmark de quelques centaines à quelques milliers de cas, c'est largement dans le bruit d'échantillonnage et de configuration.

« Devant BFCL v4 » est vrai au sens strict et sans signification pratique. Le résultat honnête est : Isaac est au niveau de GPT-5.6 Luna sur l'appel d'outils, pour un tiers du prix. C'est déjà un bon résultat.

Terminal-Bench 2.1 est le score le plus significatif du tableau : il est vérifié par exécution réelle de tâches dans un terminal, donc non devinable. 65,1 % pour un modèle de 28 milliards de paramètres est solide — et Isaac y est deuxième, pas premier.


Sécurité — DTAP

Métrique Isaac
Taux de succès d'attaque 35,6 (le plus bas du panel)
Refus explicites sur tâches malveillantes 1,5 %

Le bon score ne mesure pas ce qu'on croit

Pokee précise elle-même que ses défenses actuelles sont « essentiellement incidentelles plutôt que délibérées » et que la mesure est effectuée « garde-fous inactifs ».

Autrement dit : Isaac résiste à 64 % des attaques non pas parce qu'il refuse, mais parce qu'il échoue à les exécuter — par incapacité, maladresse ou dérive de tâche. Ce n'est pas de la sécurité, c'est de l'incompétence protectrice, et elle disparaîtra à mesure que le modèle s'améliorera.

Pour un déploiement sur site avec accès à des outils réels, la couche de refus reste entièrement à construire par l'intégrateur.


Efficacité

Métrique Valeur
Préfill à 10 M sur 1× B200 jusqu'à 137 200 tokens/s
Cache clé-valeur ≈ 5× à VRAM égale
Matériel minimal annoncé RTX 4090, Intel Arc Pro B70, NPU Qualcomm

Ce qui manque au tableau d'efficacité

Seul le préfill est publié. Ne le sont pas :

  • la latence au premier token — combien de temps avant que la réponse commence, à 10 M de tokens ? (73 secondes de préfill au minimum) ;
  • le débit de génération — combien de tokens par seconde en sortie, une fois le contexte chargé ? C'est ce qui détermine l'expérience réelle ;
  • le débit sous charge — avec plusieurs requêtes simultanées, ce qui est la seule mesure pertinente pour un service.

Un modèle qui lit 10 M de tokens en 73 secondes puis génère à 5 tokens/s serait inutilisable. Rien ne permet d'écarter ce scénario.


Classement indépendant (BenchLM)

Le seul agrégateur tiers ayant référencé le modèle au 6 août 2026 :

Catégorie Score Rang
Agentique 50,9 / 100 46ᵉ sur 132
Raisonnement 48,2 non classé
Code en attente non classé
Connaissances, mathématiques, multilingue, multimodal, suivi d'instructions aucune donnée —

BenchLM note que le modèle « ne se qualifie pas pour un classement général public » faute de couverture suffisante, tout en relevant sa force particulière « sur les tâches informatiques et l'usage agentique d'outils ».

Précision importante

BenchLM agrège des scores publiés, il ne les reproduit pas. Ce classement n'est donc pas une évaluation indépendante — c'est une mise en perspective des chiffres de Pokee dans un référentiel commun.

Il n'en est pas moins utile : il montre qu'une fois replacés parmi 132 modèles, les chiffres d'Isaac situent le modèle au milieu de tableau en agentique, et non « en classe frontière ».


Chapitre suivant : Lecture critique