Aller au contenu

Vocabulaire des quotas


Le token, unité de facturation

Un token est un fragment de texte : un mot court, un morceau de mot long, un signe de ponctuation. Les modèles de langage ne comptent ni en caractères ni en mots, mais en tokens.

Ordre de grandeur utile, pour du texte courant :

\[ 1\ \text{token} \approx 0{,}75\ \text{mot en anglais} \approx 4\ \text{caractères} \]

Une page A4 dense fait environ 500 à 700 tokens. Un fichier source de 300 lignes, environ 3 000 à 4 000 tokens.

Erreur fréquente

Les tokens d'entrée (votre prompt) et de sortie (la réponse du modèle) sont comptés séparément et n'ont presque jamais le même coût. Un quota annoncé « en tokens » sans précision désigne le plus souvent le total entrée + sortie, mais pas toujours. Cloudflare, par exemple, facture la sortie environ huit fois plus cher que l'entrée sur ses gros modèles.

Ce point compte énormément pour un agent de code : une session d'agent renvoie en boucle tout l'historique de la conversation en entrée. Une conversation de 50 échanges peut consommer des centaines de milliers de tokens d'entrée pour quelques milliers de tokens de sortie.


Les quatre limites de débit

Les fournisseurs combinent quatre compteurs. Ils s'appliquent simultanément : le premier atteint bloque la requête, avec un code HTTP 429 Too Many Requests.

Sigle Nom Ce que ça limite
RPM Requests per minute Nombre d'appels par minute
RPD Requests per day Nombre d'appels par jour
TPM Tokens per minute Volume de tokens par minute
TPD Tokens per day Volume de tokens par jour

On rencontre aussi RPH (par heure), TPH (tokens par heure) et RPS (requêtes par seconde).

Laquelle mord en premier ?

C'est la question pratique, et la réponse dépend de votre usage.

Intuition

Imaginez un robinet avec deux compteurs : un débit maximal (litres par minute) et un volume total (litres par jour). Si votre baignoire est petite, c'est le débit qui vous gêne. Si vous remplissez une piscine, c'est le volume total.

Prenons Cerebras, tier gratuit, modèle gpt-oss-120b : 5 RPM · 30 000 TPM · 1 000 000 TPD.

  • Chatbot conversationnel (petits prompts, ~1 000 tokens par appel) : la limite qui mord est 5 RPM. Vous n'atteindrez jamais les 30 000 TPM, puisque 5 appels × 1 000 tokens = 5 000 tokens/minute seulement.
  • Agent de code (gros contexte, ~25 000 tokens par appel) : la limite qui mord est 30 000 TPM. Vous ne passerez qu'un appel par minute, pas cinq.
  • Traitement par lot sur une journée : la limite qui mord est 1 M TPD.

D'où la règle de lecture des tableaux de ce rapport :

\[ \text{débit effectif} = \min\!\left( \text{RPM} \times T_{\text{req}},\; \text{TPM} \right) \quad\text{tokens par minute} \]

où \(T_{\text{req}}\) est le nombre moyen de tokens par requête dans votre usage.

Le plafond de volume est presque toujours inatteignable

Reprenons Cerebras. Le plafond quotidien est de 1 M tokens. Mais avec 30 000 TPM, il faudrait tourner sans interruption pendant 33 minutes pour l'épuiser — ce qui est possible. En revanche, avec Mistral et son ~1 Md de tokens/mois pour ~2 requêtes/minute, épuiser le quota demanderait un volume par requête irréaliste. Le grand chiffre annoncé n'est presque jamais le chiffre qui vous concerne.


Le crédit en dollars

Certains fournisseurs n'expriment pas de quota en tokens mais un crédit monétaire : un solde en dollars que vous consommez au tarif public.

Deux formes très différentes :

  • Crédit récurrent — Hugging Face Inference Providers offre 0,10 $/mois de crédits, qui se renouvellent. C'est une subvention permanente, mais minuscule : à ~0,50 $ le million de tokens sur un petit modèle, cela représente environ 200 000 tokens par mois.
  • Crédit d'inscription — 5 $ chez SambaNova, 30 $ chez Baseten, 25 $ chez Together. Ce crédit ne se renouvelle pas. Il expire en général au bout de 30 à 90 jours.

Erreur fréquente

Additionner un crédit d'inscription à un quota mensuel récurrent produit un total faux dès le deuxième mois. C'est exactement l'erreur qu'OmniRoute dit avoir corrigée : sa documentation sépare explicitement la ligne « steady » (~1,53 Md/mois, récurrent) de la ligne « premier mois » (~2,15 Md, avec les crédits d'inscription).


Le neurone Cloudflare

Cloudflare Workers AI n'utilise ni tokens ni dollars, mais une unité maison : le neurone, qui mesure du temps de calcul GPU.

L'offre gratuite est de 10 000 neurones par jour.

Le taux de conversion neurone → token dépend du modèle — c'est tout l'intérêt de l'unité pour Cloudflare, et toute sa difficulté pour vous.

D'après la grille tarifaire officielle :

Modèle Neurones / M tokens de sortie Tokens de sortie / jour 🧮 Équivalent mensuel 🧮
Llama 3.2 1B Instruct 18 252 ~548 000 ~16,4 M
Mistral 7B 17 300 ~578 000 ~17,3 M
Llama 3.1 70B Instruct 204 805 ~48 800 ~1,46 M

🧮 Calcul de ce rapport : \(\text{tokens/jour} = \dfrac{10\,000}{\text{neurones par M tokens}} \times 10^6\), puis \(\times 30\) pour le mois. L'entrée est facturée séparément et à un tarif bien plus bas — ces chiffres sont donc des maxima atteints uniquement si vous ne consommiez que de la sortie, ce qui n'arrive jamais.

À retenir

Le même quota de 10 000 neurones/jour vaut onze fois plus de tokens sur un modèle de 1 milliard de paramètres que sur un modèle de 70 milliards. Toute estimation « Cloudflare = X tokens/mois » est donc une moyenne arbitraire tant qu'on ne précise pas le modèle.


Récapitulatif

Unité Qui l'utilise Récurrent ?
RPM / RPD Presque tous oui
TPM / TPD Groq, Cerebras, Google, Mistral oui
Crédit $ récurrent Hugging Face, Nous Research oui, mensuel
Crédit $ d'inscription SambaNova, Together, Baseten, Nebius… non
Neurone Cloudflare uniquement oui, quotidien
Aucun plafond de tokens Z.AI Flash, SiliconFlow, OpenCode Zen, Kilo oui, débit seul

Cette dernière ligne est importante : plusieurs fournisseurs sont gratuits en permanence sans aucun plafond de volume publié, limités uniquement en débit ou en concurrence. Ils sont impossibles à chiffrer honnêtement — c'est pourquoi le chapitre suivant leur consacre une catégorie à part.


Chapitre suivant : Typologie des offres gratuites