Budget mensuel en tokens¶
La réponse directe à « combien de tokens par mois ? », avec la provenance de chaque chiffre.
Méthode de calcul¶
Trois règles de conversion, appliquées de façon uniforme :
où 800 est le nombre moyen de tokens de sortie par requête retenu par OmniRoute comme hypothèse conservatrice.
Ce que ces chiffres ne sont pas
Ce sont des plafonds théoriques, pas des débits soutenables. Atteindre le plafond mensuel suppose de consommer le quota quotidien tous les jours, ce que les limites de débit rendent souvent impossible en pratique — voir Le débit qui mord en premier en fin de chapitre.
Tableau principal — quotas récurrents chiffrables¶
Trié par volume décroissant. Colonne « Source » : ✅ vérifié, 📋 liste communautaire, 🧮 calcul de ce rapport.
| Fournisseur | Tokens/mois | Base de calcul | Source |
|---|---|---|---|
| Mistral (Experiment) | ~1 000 M | Plafond mensuel annoncé | 📋 ⚠️ |
| LLM7.io | ~150 M | 5 M tokens/jour × 30 | 📋 |
| Groq (tous modèles) | ~42 M 🧮 | Somme des TPD chat × 30 | ✅ 🧮 |
| Cerebras | 30 M 🧮 | 1 M TPD × 30 | ✅ 🧮 |
| Cloudflare Workers AI | ~30 M | 10 000 neurones/jour | ✅ 📋 |
| api.airforce | ~24 M | 1 000 RPD × 800 × 30 | 📋 |
| Ollama Cloud | ~20 M | Limites hebdomadaires | 📋 |
| SambaNova | 6 M 🧮 | 200 000 TPD × 30 | 📋 🧮 |
| BluesMinds | ~7 M | 300 RPD, 20 RPM | 📋 |
| Arcee AI | ~5 M | Trinity Large Preview | 📋 |
| Bazaarlink | ~4 M | 10–20 RPM, ~150 RPD | 📋 |
| OpenRouter (sans dépôt) | ~1,2 M 🧮 | 50 RPD × 800 × 30 | ✅ 🧮 |
| OpenRouter (après 10 $) | ~24 M 🧮 | 1 000 RPD × 800 × 30 | ✅ 🧮 |
| Cohere | ~800 K 🧮 | 1 000 appels/mois × 800 | ✅ 🧮 |
| Morph | ~400 K | 200 requêtes/mois | 📋 |
| Hugging Face | ~200 K | 0,10 $/mois | 📋 |
| Aion Labs | ~600 K 🧮 | 20 000 tokens/jour × 30 | 📋 🧮 |
| Kiro | ~25 K | 50 crédits/mois | 📋 |
Détail du calcul Groq 🧮¶
Somme des plafonds quotidiens en tokens des modèles de conversation, quotas étant par modèle et non partagés :
| Modèle | TPD |
|---|---|
llama-3.1-8b-instant |
500 000 |
openai/gpt-oss-120b |
200 000 |
openai/gpt-oss-20b |
200 000 |
openai/gpt-oss-safeguard-20b |
200 000 |
qwen/qwen3.6-27b |
200 000 |
llama-3.3-70b-versatile |
100 000 |
| Total | 1 400 000 / jour |
Soit 42 000 000 tokens/mois.
Pourquoi OmniRoute annonce 15 M et non 42 M pour Groq
OmniRoute applique une déduplication par pool : quand plusieurs modèles d'un même fournisseur partagent une ressource, il ne compte le pool qu'une fois. C'est prudent, et sur Groq c'est probablement trop prudent — la documentation officielle présente bien des quotas par modèle. Les deux chiffres sont défendables ; le mien est un maximum, le leur un plancher.
Fournisseurs sans plafond de tokens publié¶
Gratuits en permanence, limités uniquement en débit ou en concurrence. Ils ne sont pas chiffrables et ne doivent pas être additionnés.
| Fournisseur | Limite connue | Modèles gratuits |
|---|---|---|
Z.AI / Zhipu (glm-cn) |
1 requête simultanée | GLM-4.7 / 4.5 / 4.6V / 4-Flash |
| SiliconFlow | 30 RPM, 60 000 TPM | Qwen3-8B, DeepSeek R1 Distill… |
| NVIDIA NIM | ~40 RPM partagés | 123 modèles |
| Kilo Gateway | 200 requêtes/heure par IP | Nemotron 3, StepFun, Poolside… |
| OpenCode Zen | Non publiée | 6–7 modèles rotatifs |
| Baidu ERNIE | Non publiée | ERNIE Speed / Lite / Tiny |
| Tencent | Non publiée | Hunyuan-lite |
| iFlytek Spark | 2 requêtes/seconde par App ID | Spark Lite |
Le piège du plafond théorique
Convertir ces limites en volume mensuel produit des chiffres absurdes. NVIDIA à 40 RPM et 2 000 tokens par requête donnerait ~3,5 milliards de tokens/mois à lui seul, en supposant un usage ininterrompu 24 h/24 pendant 30 jours.
C'est exactement de cette façon qu'on passe de 1,53 milliard défendable à 10 milliards théoriques — le calcul qu'OmniRoute publie et rejette explicitement dans sa propre documentation.
Total agrégé — trois chiffres, trois significations¶
| Chiffre | Ce qu'il couvre | Honnêteté |
|---|---|---|
| ~1,53 Md/mois | Quotas récurrents chiffrables, 43 pools, dédupliqués | Défendable |
| ~2,15 Md | Le précédent + crédits d'inscription, premier mois seulement | Défendable si daté |
| ~10 Md/mois | Le précédent + limites de débit extrapolées 24 h/24 | Trompeur |
| ~4 Md/mois | Chiffre annoncé par FreeLLMAPI sur 29 fournisseurs | Non décomposé publiquement |
Le total est dominé par un seul fournisseur
Sur les ~1,53 Md, Mistral pèse ~1,00 Md — soit environ 65 %. Les contributeurs suivants sont LLM7 (150 M), Groq (117 M dans le décompte OmniRoute), Gemini (60 M), Cerebras (30 M), Cloudflare (30 M), SambaNova (30 M).
Retirez Mistral et le total tombe à ~500 M/mois, répartis sur une quarantaine de fournisseurs. Or Mistral est aussi le chiffre le moins bien vérifié du corpus, et le seul dont le fournisseur soit passé à des limites négociées par organisation.
L'historique des corrections d'OmniRoute¶
Le point le plus instructif du corpus : ce projet publie ses révisions à la baisse, ce qui donne une idée de la volatilité réelle du domaine.
| Version | Total annoncé | Ce qui a changé |
|---|---|---|
| Avant juin 2026 | ~1,94 Md | — |
| 17 juin 2026 | ~1,53 Md | Gemini dédupliqué par pool (462 M → 60 M), Cloudflare corrigé (122 M → 30 M), Doubao reclassé en crédit unique, tiers fermés retirés |
| v3.8.42 | ~1,37 Md | LongCat reclassé de 150 M récurrents en 10 M d'inscription |
| v3.8.49 | ~1,53 Md | +4 pools (Requesty, OVHcloud, Agnes, GLM) + 2 nouveaux (Navy, AIHorde) |
À retenir
Une correction de 462 M → 60 M sur Gemini, soit un facteur 7,7, pour une simple erreur de méthode (compter chaque variante Flash comme un quota séparé alors qu'elles partagent le pool). Cela donne la mesure de l'incertitude qui pèse sur tout chiffre agrégé de ce type.
Le débit qui mord en premier¶
Le tableau ci-dessus donne des plafonds de volume. En pratique, c'est presque toujours le débit qui vous bloque. Comparaison pour un agent de code consommant ~20 000 tokens par appel :
| Fournisseur | Plafond mensuel | Débit | Appels/minute effectifs 🧮 |
|---|---|---|---|
| Mistral | ~1 000 M | ~2 RPS annoncé, mais 25 K–20 M TPM selon modèle | variable |
| Cerebras | 30 M | 30 000 TPM | 1,5 |
Groq (gpt-oss-120b) |
6 M | 8 000 TPM | 0,4 |
| Google (Flash) | ~60 M | 250 000 TPM mais 20 RPD ⚠️ | 20/jour |
| NVIDIA NIM | non plafonné | 40 RPM partagés | 40 |
| Cloudflare | ~30 M | non publié | — |
À retenir
NVIDIA NIM est le seul de la liste à offrir un débit confortable pour un agent de code, précisément parce qu'il ne publie pas de plafond de volume. Les fournisseurs au gros plafond mensuel (Mistral, Google) sont ceux dont le débit est le plus contraint — ce n'est pas un hasard.
Chapitre suivant : Fournisseurs disparus en 2026