Aller au contenu

Résumé exécutif


Les cinq chiffres à retenir

Chiffre Ce qu'il signifie
~1,53 milliard Tokens gratuits par mois agrégés par OmniRoute sur 43 pools de fournisseurs, après déduplication honnête des pools partagés
~4 milliards Le même type de chiffre annoncé par FreeLLMAPI sur 29 fournisseurs — non détaillé publiquement, donc invérifiable
~10 milliards Le « plafond théorique » qu'OmniRoute calcule et rejette : c'est ce qu'on obtient en extrapolant chaque limite de débit à un usage 24 h/24
~1 milliard Tokens/mois du seul tier gratuit Mistral (Experiment) — à lui seul environ deux tiers du total agrégé
30 millions Tokens/mois de Cerebras (1 M/jour), l'un des rares plafonds quotidiens en tokens à la fois généreux et clairement documenté

Ce qu'il faut comprendre en premier

L'essentiel

Le total agrégé est massivement dominé par un seul fournisseur. Mistral pèse à lui seul environ 1,00 milliard des ~1,53 milliard annoncés par OmniRoute. Retirez Mistral, et l'ensemble de l'écosystème gratuit restant tombe à environ 500 millions de tokens par mois — répartis sur une quarantaine de fournisseurs, avec des limites de débit qui rendent impossible de les consommer réellement.

Autrement dit : le chiffre marketing « des milliards de tokens gratuits » est techniquement défendable mais opérationnellement trompeur. Vous ne pouvez pas consommer 1,53 milliard de tokens en un mois, parce que les limites de débit (quelques requêtes par minute) vous en empêchent bien avant que le plafond de volume soit atteint.


Les meilleurs fournisseurs, par usage

Usage Fournisseur recommandé Pourquoi
Volume brut Mistral (Experiment) ~1 Md tokens/mois, mais ~2 requêtes/minute
Vitesse Cerebras, Groq Inférence très rapide, quotas quotidiens explicites
Modèles récents NVIDIA NIM Catalogue large, ~40 RPM partagés, vérification téléphonique
Aucune inscription Cloudflare Workers AI 10 000 neurones/jour, compte Cloudflare gratuit
Contexte long Google AI Studio (famille Flash) 1 M tokens de contexte, mais quotas quotidiens très serrés
Sans plafond de tokens Z.AI (GLM Flash), SiliconFlow, OpenCode Zen, Kilo Gratuit permanent, limité en débit/concurrence seulement

Les trois pièges

1. Les listes se contredisent

Sur le tier gratuit de Google AI Studio, trois sources donnent trois réponses incompatibles pour le même modèle : 20 requêtes/jour, 1 500 requêtes/jour, ou « consultez votre tableau de bord ». C'est le désaccord le plus grave du corpus, détaillé dans Fiabilité des chiffres.

2. Les listes contiennent des offres mortes

La liste awesome-free-llm-apis, pourtant régénérée le 3 août 2026, référence encore GitHub Models avec 16 modèles gratuits — alors que le service a été entièrement retiré le 30 juillet 2026. Voir Fournisseurs disparus.

3. Une partie du « gratuit » n'est pas une API

Sur les 290 fournisseurs d'OmniRoute, 31 sont des accès par cookie de session vers des applications web (ChatGPT, Claude.ai, Perplexity, Qwen…). Ce ne sont pas des tiers gratuits d'API : ce sont des sessions de navigateur rejouées par un programme, en violation explicite des conditions d'utilisation de la plupart de ces services. Voir Conditions d'utilisation.


Verdict sur les deux agrégateurs

FreeLLMAPI OmniRoute
Dépôt tashfeenahmed/freellmapi diegosouzapw/OmniRoute
Étoiles GitHub (3 août 2026) ~17 600 ~38 400
Fournisseurs annoncés 29 290 (dont 90+ gratuits)
Tokens gratuits annoncés ~4 Md/mois ~1,53 Md/mois
Méthodologie publiée ? ❌ non ✅ oui, détaillée
Modèle économique Freemium (catalogue live à 19 $/an) MIT, entièrement gratuit

OmniRoute publie sa méthodologie, y compris ses corrections à la baisse. FreeLLMAPI annonce un chiffre 2,6 fois supérieur sans le décomposer publiquement et réserve le catalogue détaillé à son offre payante. Sur le seul critère de la vérifiabilité, OmniRoute est la source plus solide — ce qui ne dit rien de la qualité respective des deux logiciels. Détails dans Comparaison.


Recommandation en une phrase

Pour un usage personnel réel, deux ou trois clés suffisent — typiquement Cerebras + Groq + Mistral — et l'ajout d'un routeur ne se justifie que si vous êtes déjà bloqué par les limites de débit ; voir Recommandations pratiques.