Accès, prix et déploiement¶
Les tarifs¶
| Poste | Prix officiel Pokee | Via NanoGPT (revendeur) |
|---|---|---|
| Entrée | 0,15 $ / M de tokens | 0,16 $ / M |
| Sortie | 1,00 $ / M de tokens | 1,05 $ / M |
| Lecture en cache | non publié | 0,079 $ / M |
Le prix est forfaitaire quelle que soit la longueur de contexte utilisée — point important, car plusieurs concurrents facturent un tarif majoré au-delà d'un certain seuil.
BenchLM calcule un prix mixte (3 entrées pour 1 sortie) de 0,57 $ / M.
Ce que coûte réellement un contexte plein¶
C'est le calcul que l'affichage « 0,15 $ » masque :
1,50 $ par appel utilisant la totalité de la fenêtre, avant même de compter la sortie. Un agent qui effectue cinquante tours à contexte plein dépense 75 $ pour une seule tâche.
D'où l'importance du cache de préfixe
À 0,079 $ / M en lecture de cache (tarif revendeur), un contexte de 10 M déjà mis en cache retombe à 0,79 $ par appel — presque la moitié. Pour un agent qui rejoue le même contexte à chaque tour, le cache n'est pas une optimisation, c'est la condition de viabilité économique.
Comparaison de prix d'entrée¶
Panel tel que publié par Pokee :
| Modèle | Entrée ($/M) |
|---|---|
| Pokee-Isaac 28B | 0,15 |
| Nemotron 3 Super | 0,15 |
| Qwen 3.5 122B | 0,26 |
| Gemini 3.5 Flash Lite | 0,30 |
| GPT-5.6 Luna | 0,40 |
| Claude Haiku 4.5 | 1,00 |
Le panel est celui de la classe économique
Ces six modèles sont des modèles rapides et peu chers, pas les modèles phares de leurs éditeurs. Le message « moins cher que tous les modèles comparés » est vrai dans ce panel, qui a été choisi par Pokee.
Pokee note d'ailleurs elle-même que « trois des modèles du panel affichent un tarif mais ne peuvent pas être achetés à ces longueurs de contexte » — ce qui revient à admettre que la comparaison de prix à 10 M n'a pas de contrepartie réelle chez les concurrents.
Modes de déploiement¶
| Mode | Description |
|---|---|
| API gérée | Compatible OpenAI, via console.pokee.ai |
| VPC client | Déploiement dans le cloud privé du client |
| Sur site (on-premise) | Serveurs du client |
| Embarqué (on-device) | RTX 4090, Intel Arc Pro B70, NPU mobile Qualcomm |
Moteurs d'inférence supportés : vLLM et SGLang.
Pourquoi ce détail est un indice architectural
vLLM et SGLang ne gèrent que les architectures qu'on leur enseigne. Un support annoncé implique soit une contribution de code de Pokee à ces projets (donc, à terme, une architecture lisible dans le code source ouvert), soit un greffon propriétaire.
Dans le premier cas, l'architecture d'Isaac deviendrait publique par la petite porte. C'est la piste la plus prometteuse pour qui veut réellement savoir « comment ils ont fait » : surveiller les dépôts vLLM et SGLang.
Le modèle est fermé : aucun poids n'est publié en téléchargement. Le déploiement sur site suppose une licence commerciale.
Politique de données¶
Pokee indique que les invites et sorties des développeurs ne sont pas utilisées pour l'entraînement. Son infrastructure conserve :
- un aperçu de 120 caractères pendant 1 jour ;
- les charges utiles brutes chiffrées pendant 7 jours au maximum.
C'est une politique standard pour un fournisseur d'API en 2026, et cohérente avec un positionnement entreprise.
Limites fonctionnelles déclarées¶
| Limite | Détail |
|---|---|
| Modalités | Texte uniquement — ni image, ni audio, ni vidéo |
| Sortie maximale | 60 000 tokens |
| Mode raisonnement | Explicite, activable |
| Fonctions | Appel d'outils et sorties structurées compatibles OpenAI |
Sur la sécurité, l'aveu est explicite
Pokee écrit que ses défenses actuelles sont « essentiellement incidentelles plutôt que délibérées », avec des refus explicites sur seulement 1,5 % des tâches malveillantes. Le bon score DTAP (35,6 de taux de succès d'attaque, le plus bas du panel) reflète donc une mesure « garde-fous inactifs » : le modèle résiste, mais pas parce qu'il a été entraîné à refuser.
Pour un déploiement sur site avec accès à des outils réels, c'est un point d'attention majeur : la couche de refus est à construire par l'intégrateur.