Aller au contenu

Budget mensuel en tokens

La réponse directe à « combien de tokens par mois ? », avec la provenance de chaque chiffre.


Méthode de calcul

Trois règles de conversion, appliquées de façon uniforme :

\[ \text{tokens/mois} = \text{TPD} \times 30 \qquad\text{(plafond quotidien en tokens publié)} \]
\[ \text{tokens/mois} \approx \text{RPD} \times 800 \times 30 \qquad\text{(seul le plafond en requêtes est publié)} \]

où 800 est le nombre moyen de tokens de sortie par requête retenu par OmniRoute comme hypothèse conservatrice.

\[ \text{tokens/mois} = \frac{\text{crédit mensuel en \$}}{\text{prix par M tokens}} \times 10^{6} \qquad\text{(crédit récurrent en dollars)} \]

Ce que ces chiffres ne sont pas

Ce sont des plafonds théoriques, pas des débits soutenables. Atteindre le plafond mensuel suppose de consommer le quota quotidien tous les jours, ce que les limites de débit rendent souvent impossible en pratique — voir Le débit qui mord en premier en fin de chapitre.


Tableau principal — quotas récurrents chiffrables

Trié par volume décroissant. Colonne « Source » : ✅ vérifié, 📋 liste communautaire, 🧮 calcul de ce rapport.

Fournisseur Tokens/mois Base de calcul Source
Mistral (Experiment) ~1 000 M Plafond mensuel annoncé 📋 ⚠️
LLM7.io ~150 M 5 M tokens/jour × 30 📋
Groq (tous modèles) ~42 M 🧮 Somme des TPD chat × 30 ✅ 🧮
Cerebras 30 M 🧮 1 M TPD × 30 ✅ 🧮
Cloudflare Workers AI ~30 M 10 000 neurones/jour ✅ 📋
api.airforce ~24 M 1 000 RPD × 800 × 30 📋
Ollama Cloud ~20 M Limites hebdomadaires 📋
SambaNova 6 M 🧮 200 000 TPD × 30 📋 🧮
BluesMinds ~7 M 300 RPD, 20 RPM 📋
Arcee AI ~5 M Trinity Large Preview 📋
Bazaarlink ~4 M 10–20 RPM, ~150 RPD 📋
OpenRouter (sans dépôt) ~1,2 M 🧮 50 RPD × 800 × 30 ✅ 🧮
OpenRouter (après 10 $) ~24 M 🧮 1 000 RPD × 800 × 30 ✅ 🧮
Cohere ~800 K 🧮 1 000 appels/mois × 800 ✅ 🧮
Morph ~400 K 200 requêtes/mois 📋
Hugging Face ~200 K 0,10 $/mois 📋
Aion Labs ~600 K 🧮 20 000 tokens/jour × 30 📋 🧮
Kiro ~25 K 50 crédits/mois 📋

Détail du calcul Groq 🧮

Somme des plafonds quotidiens en tokens des modèles de conversation, quotas étant par modèle et non partagés :

Modèle TPD
llama-3.1-8b-instant 500 000
openai/gpt-oss-120b 200 000
openai/gpt-oss-20b 200 000
openai/gpt-oss-safeguard-20b 200 000
qwen/qwen3.6-27b 200 000
llama-3.3-70b-versatile 100 000
Total 1 400 000 / jour

Soit 42 000 000 tokens/mois.

Pourquoi OmniRoute annonce 15 M et non 42 M pour Groq

OmniRoute applique une déduplication par pool : quand plusieurs modèles d'un même fournisseur partagent une ressource, il ne compte le pool qu'une fois. C'est prudent, et sur Groq c'est probablement trop prudent — la documentation officielle présente bien des quotas par modèle. Les deux chiffres sont défendables ; le mien est un maximum, le leur un plancher.


Fournisseurs sans plafond de tokens publié

Gratuits en permanence, limités uniquement en débit ou en concurrence. Ils ne sont pas chiffrables et ne doivent pas être additionnés.

Fournisseur Limite connue Modèles gratuits
Z.AI / Zhipu (glm-cn) 1 requête simultanée GLM-4.7 / 4.5 / 4.6V / 4-Flash
SiliconFlow 30 RPM, 60 000 TPM Qwen3-8B, DeepSeek R1 Distill…
NVIDIA NIM ~40 RPM partagés 123 modèles
Kilo Gateway 200 requêtes/heure par IP Nemotron 3, StepFun, Poolside…
OpenCode Zen Non publiée 6–7 modèles rotatifs
Baidu ERNIE Non publiée ERNIE Speed / Lite / Tiny
Tencent Non publiée Hunyuan-lite
iFlytek Spark 2 requêtes/seconde par App ID Spark Lite

Le piège du plafond théorique

Convertir ces limites en volume mensuel produit des chiffres absurdes. NVIDIA à 40 RPM et 2 000 tokens par requête donnerait ~3,5 milliards de tokens/mois à lui seul, en supposant un usage ininterrompu 24 h/24 pendant 30 jours.

C'est exactement de cette façon qu'on passe de 1,53 milliard défendable à 10 milliards théoriques — le calcul qu'OmniRoute publie et rejette explicitement dans sa propre documentation.


Total agrégé — trois chiffres, trois significations

Chiffre Ce qu'il couvre Honnêteté
~1,53 Md/mois Quotas récurrents chiffrables, 43 pools, dédupliqués Défendable
~2,15 Md Le précédent + crédits d'inscription, premier mois seulement Défendable si daté
~10 Md/mois Le précédent + limites de débit extrapolées 24 h/24 Trompeur
~4 Md/mois Chiffre annoncé par FreeLLMAPI sur 29 fournisseurs Non décomposé publiquement

Le total est dominé par un seul fournisseur

Sur les ~1,53 Md, Mistral pèse ~1,00 Md — soit environ 65 %. Les contributeurs suivants sont LLM7 (150 M), Groq (117 M dans le décompte OmniRoute), Gemini (60 M), Cerebras (30 M), Cloudflare (30 M), SambaNova (30 M).

Retirez Mistral et le total tombe à ~500 M/mois, répartis sur une quarantaine de fournisseurs. Or Mistral est aussi le chiffre le moins bien vérifié du corpus, et le seul dont le fournisseur soit passé à des limites négociées par organisation.


L'historique des corrections d'OmniRoute

Le point le plus instructif du corpus : ce projet publie ses révisions à la baisse, ce qui donne une idée de la volatilité réelle du domaine.

Version Total annoncé Ce qui a changé
Avant juin 2026 ~1,94 Md —
17 juin 2026 ~1,53 Md Gemini dédupliqué par pool (462 M → 60 M), Cloudflare corrigé (122 M → 30 M), Doubao reclassé en crédit unique, tiers fermés retirés
v3.8.42 ~1,37 Md LongCat reclassé de 150 M récurrents en 10 M d'inscription
v3.8.49 ~1,53 Md +4 pools (Requesty, OVHcloud, Agnes, GLM) + 2 nouveaux (Navy, AIHorde)

À retenir

Une correction de 462 M → 60 M sur Gemini, soit un facteur 7,7, pour une simple erreur de méthode (compter chaque variante Flash comme un quota séparé alors qu'elles partagent le pool). Cela donne la mesure de l'incertitude qui pèse sur tout chiffre agrégé de ce type.


Le débit qui mord en premier

Le tableau ci-dessus donne des plafonds de volume. En pratique, c'est presque toujours le débit qui vous bloque. Comparaison pour un agent de code consommant ~20 000 tokens par appel :

Fournisseur Plafond mensuel Débit Appels/minute effectifs 🧮
Mistral ~1 000 M ~2 RPS annoncé, mais 25 K–20 M TPM selon modèle variable
Cerebras 30 M 30 000 TPM 1,5
Groq (gpt-oss-120b) 6 M 8 000 TPM 0,4
Google (Flash) ~60 M 250 000 TPM mais 20 RPD ⚠️ 20/jour
NVIDIA NIM non plafonné 40 RPM partagés 40
Cloudflare ~30 M non publié —

À retenir

NVIDIA NIM est le seul de la liste à offrir un débit confortable pour un agent de code, précisément parce qu'il ne publie pas de plafond de volume. Les fournisseurs au gros plafond mensuel (Mistral, Google) sont ceux dont le débit est le plus contraint — ce n'est pas un hasard.


Chapitre suivant : Fournisseurs disparus en 2026