Aller au contenu

Accès, prix et déploiement

Les tarifs

Poste Prix officiel Pokee Via NanoGPT (revendeur)
Entrée 0,15 $ / M de tokens 0,16 $ / M
Sortie 1,00 $ / M de tokens 1,05 $ / M
Lecture en cache non publié 0,079 $ / M

Le prix est forfaitaire quelle que soit la longueur de contexte utilisée — point important, car plusieurs concurrents facturent un tarif majoré au-delà d'un certain seuil.

BenchLM calcule un prix mixte (3 entrées pour 1 sortie) de 0,57 $ / M.

Ce que coûte réellement un contexte plein

C'est le calcul que l'affichage « 0,15 $ » masque :

\[ C = \frac{10^7}{10^6} \times 0{,}15 = 1{,}50\ \text{\$} \]

1,50 $ par appel utilisant la totalité de la fenêtre, avant même de compter la sortie. Un agent qui effectue cinquante tours à contexte plein dépense 75 $ pour une seule tâche.

D'où l'importance du cache de préfixe

À 0,079 $ / M en lecture de cache (tarif revendeur), un contexte de 10 M déjà mis en cache retombe à 0,79 $ par appel — presque la moitié. Pour un agent qui rejoue le même contexte à chaque tour, le cache n'est pas une optimisation, c'est la condition de viabilité économique.

Comparaison de prix d'entrée

Panel tel que publié par Pokee :

Modèle Entrée ($/M)
Pokee-Isaac 28B 0,15
Nemotron 3 Super 0,15
Qwen 3.5 122B 0,26
Gemini 3.5 Flash Lite 0,30
GPT-5.6 Luna 0,40
Claude Haiku 4.5 1,00

Le panel est celui de la classe économique

Ces six modèles sont des modèles rapides et peu chers, pas les modèles phares de leurs éditeurs. Le message « moins cher que tous les modèles comparés » est vrai dans ce panel, qui a été choisi par Pokee.

Pokee note d'ailleurs elle-même que « trois des modèles du panel affichent un tarif mais ne peuvent pas être achetés à ces longueurs de contexte » — ce qui revient à admettre que la comparaison de prix à 10 M n'a pas de contrepartie réelle chez les concurrents.


Modes de déploiement

Mode Description
API gérée Compatible OpenAI, via console.pokee.ai
VPC client Déploiement dans le cloud privé du client
Sur site (on-premise) Serveurs du client
Embarqué (on-device) RTX 4090, Intel Arc Pro B70, NPU mobile Qualcomm

Moteurs d'inférence supportés : vLLM et SGLang.

Pourquoi ce détail est un indice architectural

vLLM et SGLang ne gèrent que les architectures qu'on leur enseigne. Un support annoncé implique soit une contribution de code de Pokee à ces projets (donc, à terme, une architecture lisible dans le code source ouvert), soit un greffon propriétaire.

Dans le premier cas, l'architecture d'Isaac deviendrait publique par la petite porte. C'est la piste la plus prometteuse pour qui veut réellement savoir « comment ils ont fait » : surveiller les dépôts vLLM et SGLang.

Le modèle est fermé : aucun poids n'est publié en téléchargement. Le déploiement sur site suppose une licence commerciale.


Politique de données

Pokee indique que les invites et sorties des développeurs ne sont pas utilisées pour l'entraînement. Son infrastructure conserve :

  • un aperçu de 120 caractères pendant 1 jour ;
  • les charges utiles brutes chiffrées pendant 7 jours au maximum.

C'est une politique standard pour un fournisseur d'API en 2026, et cohérente avec un positionnement entreprise.


Limites fonctionnelles déclarées

Limite Détail
Modalités Texte uniquement — ni image, ni audio, ni vidéo
Sortie maximale 60 000 tokens
Mode raisonnement Explicite, activable
Fonctions Appel d'outils et sorties structurées compatibles OpenAI

Sur la sécurité, l'aveu est explicite

Pokee écrit que ses défenses actuelles sont « essentiellement incidentelles plutôt que délibérées », avec des refus explicites sur seulement 1,5 % des tâches malveillantes. Le bon score DTAP (35,6 de taux de succès d'attaque, le plus bas du panel) reflète donc une mesure « garde-fous inactifs » : le modèle résiste, mais pas parce qu'il a été entraîné à refuser.

Pour un déploiement sur site avec accès à des outils réels, c'est un point d'attention majeur : la couche de refus est à construire par l'intégrateur.