Tier gratuit permanent¶
Fournisseurs dont l'offre gratuite se renouvelle. Chiffres au 3 août 2026.
Vue d'ensemble¶
| Fournisseur | Carte bancaire | Autre condition | Limite dominante |
|---|---|---|---|
| Cerebras | Non pour le tier gratuit | — | 1 M tokens/jour |
| Groq | Non | — | TPD par modèle |
| Google AI Studio | Non | Données d'entraînement hors UE/EEE/CH/UK | RPD ⚠️ |
| Mistral La Plateforme | Non | Téléphone + opt-in entraînement | ~2 RPS |
| NVIDIA NIM | Non | Vérification téléphonique | ~40 RPM partagés |
| Cloudflare Workers AI | Non | — | 10 000 neurones/jour |
| Cohere | Non | — | 1 000 appels/mois |
| OpenRouter | Non | Solde ≥ 0 | 50 req/jour |
| Hugging Face | Non | — | 0,10 $/mois |
| Z.AI / Zhipu | Non | — | 1 requête simultanée |
| Kilo Gateway | Non | Aucune (sans compte) | 200 req/heure par IP |
| OpenCode Zen | Non | Inscription | non publiée |
| Vercel AI Gateway | Non | — | 5 $/mois |
| SambaNova | Non | Inscription | 20 req/jour |
| OVHcloud AI Endpoints | Non | Inscription | 2 RPM anonyme |
Cerebras¶
✅ Vérifié — documentation officielle, consultée le 3 août 2026.
| Modèle | RPM | TPM | TPH | TPD |
|---|---|---|---|---|
gpt-oss-120b |
5 | 30 000 | 1 000 000 | 1 000 000 |
zai-glm-4.7 |
5 | 30 000 | 1 000 000 | 1 000 000 |
gemma-4-31b |
5 | 30 000 | 1 000 000 | 1 000 000 |
gemma-4-31b accepte en plus 2 images par requête, 4 Mo maximum.
Deux offres à ne pas confondre
Cerebras propose un tier gratuit permanent (le tableau ci-dessus, sans carte) et un crédit de 5 $ valable 30 jours, qui lui exige l'ajout d'un moyen de paiement vérifié. Les pages tarifaires mélangent les deux.
Resserrement en 2026
Le TPM est passé de 60 000 à 30 000 sur les modèles documentés, et la limite
de 5 RPM est devenue explicite. Le plafond quotidien de 1 M tokens, lui, est
inchangé. Par ailleurs zai-glm-4.7 est annoncé déprécié pour août 2026.
Verdict : le meilleur rapport clarté/générosité de la liste. Un plafond quotidien net, une inférence très rapide, aucune ambiguïté.
Groq¶
✅ Vérifié — console.groq.com/docs/rate-limits, consultée le 3 août 2026.
| Modèle | RPM | RPD | TPM | TPD |
|---|---|---|---|---|
llama-3.1-8b-instant |
30 | 14 400 | 6 000 | 500 000 |
llama-3.3-70b-versatile |
30 | 1 000 | 12 000 | 100 000 |
openai/gpt-oss-120b |
30 | 1 000 | 8 000 | 200 000 |
openai/gpt-oss-20b |
30 | 1 000 | 8 000 | 200 000 |
openai/gpt-oss-safeguard-20b |
30 | 1 000 | 8 000 | 200 000 |
qwen/qwen3.6-27b |
30 | 1 000 | 8 000 | 200 000 |
groq/compound |
30 | 250 | 70 000 | — |
groq/compound-mini |
30 | 250 | 70 000 | — |
meta-llama/llama-prompt-guard-2-22m |
30 | 14 400 | 15 000 | 500 000 |
meta-llama/llama-prompt-guard-2-86m |
30 | 14 400 | 15 000 | 500 000 |
whisper-large-v3 |
20 | 2 000 | — | — |
whisper-large-v3-turbo |
20 | 2 000 | — | — |
canopylabs/orpheus-v1-english |
10 | 100 | 1 200 | 3 600 |
canopylabs/orpheus-arabic-saudi |
10 | 100 | 1 200 | 3 600 |
Erreur fréquente
La formule « Groq = 30 RPM / 14 400 RPD » circule partout. Elle n'est vraie
que pour llama-3.1-8b-instant et les modèles de garde. Tous les modèles
intéressants sont à 1 000 RPD, soit quatorze fois moins. OmniRoute
identifie explicitement cette confusion comme une erreur de son propre
catalogue historique.
Les quotas sont par modèle, pas partagés : vous pouvez consommer
500 000 tokens/jour sur le 8B et 200 000 sur gpt-oss-120b le même jour.
Verdict : excellent pour la vitesse et pour les petits modèles. Les 8 000
TPM sur gpt-oss-120b rendent l'usage en agent de code difficile (un seul appel
à gros contexte sature la minute).
Google AI Studio¶
⚠️ Sources en désaccord. C'est le point le plus incertain de tout le rapport.
Google ne publie plus de table de quotas dans sa documentation : la page officielle sur les limites de débit renvoie désormais au tableau de bord AI Studio de chaque projet, et précise que « les limites indiquées ne sont pas garanties ». Les limites s'appliquent par projet, pas par clé.
Version A — liste cheahjs, générée le 29 juillet 2026 📋¶
| Modèle | TPM | RPD | RPM |
|---|---|---|---|
| Gemini 3.6 / 3.5 / 3 Flash | 250 000 | 20 | 5 |
| Gemini 3.5 / 3.1 Flash-Lite | 250 000 | 500 | 15 |
| Gemini 2.5 Flash | 250 000 | 20 | 5 |
| Gemini 2.5 Flash-Lite | 250 000 | 20 | 10 |
| Gemini 3.1 / 2.5 Flash TTS | 10 000 | 10 | 3 |
| Gemini Robotics-ER 1.6 | 250 000 | 20 | 5 |
| Gemma 4 31B / 4 26B A4B | 16 000 | 14 400 | 30 |
| Gemma 3 (27B / 12B / 4B / 1B) | 15 000 | 14 400 | 30 |
Version B — freellm.net, données du 3 août 2026 📋¶
| Modèle | RPM | RPD |
|---|---|---|
| Gemini 3.6 Flash | 15 | 1 500 |
| Gemini 3.5 Flash | 15 | 1 500 |
| Gemini 3.5 Flash-Lite | 30 | 1 500 |
Version C — sources secondaires, mi-2026¶
Gemini 3 Flash : 10 RPM, 250 000 TPM, 1 500 RPD.
Que faire de ce désaccord
L'écart entre 20 et 1 500 requêtes/jour est d'un facteur 75. Il change complètement l'utilité du tier gratuit Google.
Éléments de contexte : OmniRoute documente que Google a réduit ses quotas gratuits de 50 à 80 % en décembre 2025, que Gemini 2.0 Flash et 2.0 Flash-Lite ont été arrêtés le 1ᵉʳ juin 2026, et que Gemini 2.5 Pro a quitté le tier gratuit en avril 2026 — le gratuit est désormais famille Flash uniquement. La version A, la plus récente et générée automatiquement depuis les sources Google, est aussi la plus pessimiste, ce qui est cohérent avec une tendance au resserrement. La version B ressemble à un chiffre pré-décembre 2025 non rafraîchi.
Conclusion pratique : n'utilisez aucun de ces chiffres. Ouvrez le tableau de bord de limites d'AI Studio avec votre propre compte — c'est la seule source qui fasse foi, et Google le dit explicitement.
Utilisation de vos données
Hors Royaume-Uni, Suisse, EEE et Union européenne, les données envoyées au tier gratuit sont utilisées pour l'entraînement. C'est la contrepartie explicite de la gratuité.
Point positif à noter : les modèles Gemma (poids ouverts, servis par Google) conservent 14 400 requêtes/jour dans les deux versions. C'est de très loin le quota en requêtes le plus généreux du tier gratuit Google, et il est cohérent entre les sources.
Mistral (La Plateforme)¶
Le plus gros contributeur en volume de tout l'écosystème.
Conditions ✅ : plan Experiment, gratuit, sans carte bancaire, mais avec vérification par téléphone et acceptation obligatoire de l'utilisation des données pour l'entraînement.
Le chiffre annoncé¶
~1 000 000 000 tokens/mois (≈ 1 milliard), avec un débit très bas (de l'ordre de 1 à 2 requêtes/seconde selon le modèle).
Provenance : OmniRoute (~1.00B, recherche du 17 juin 2026) et plusieurs
sources secondaires de juillet 2026. Non confirmé dans la documentation
officielle consultée pour ce rapport — les URL de documentation des limites de
débit Mistral renvoient une erreur 404 depuis leur réorganisation.
La nuance importante 📋¶
La liste cheahjs, générée le 29 juillet 2026, indique que les limites Mistral
sont désormais fixées par modèle et par organisation, consultables sur
admin.mistral.ai/plateforme/limits,
et qu'« en juillet 2026, un nouveau compte gratuit voit entre 25 000 et
20 000 000 tokens/minute et entre 0,03 et 12,5 requêtes/seconde selon le
modèle ».
Le milliard est à prendre avec précaution
Ce milliard de tokens/mois représente à lui seul environ deux tiers du total de 1,53 Md agrégé par OmniRoute. C'est aussi le chiffre le moins bien vérifié du corpus, et il ne correspond plus au modèle de tarification décrit par Mistral, qui est passé à des limites négociées par organisation.
Vérifiez votre propre page de limites avant de bâtir quoi que ce soit dessus. Un chiffre annoncé pour l'ensemble d'une flotte n'est pas forcément ce que voit votre compte.
Mistral Codestral (endpoint séparé)¶
📋 Gratuit, sur abonnement mensuel, vérification téléphonique requise : 30 requêtes/minute, 2 000 requêtes/jour sur le modèle Codestral.
NVIDIA NIM¶
📋 + sources concordantes. Vérification téléphonique obligatoire.
- ~40 requêtes/minute, partagées entre tous les modèles de la clé.
- Pas de plafond de tokens publié.
- Catalogue très large (123 modèles gratuits selon
freellm.net), incluant des modèles récents et de gros contextes (jusqu'à 1 M tokens). - Les modèles sont souvent limités en fenêtre de contexte par rapport à leur version native.
L'ancien pool de crédits d'inscription a été supprimé : l'accès est désormais un tier de développement gratuit pur.
Verdict : le meilleur catalogue de modèles récents en gratuit. Les 40 RPM partagés sont la contrainte réelle, et plusieurs demandes d'augmentation sur le forum développeurs NVIDIA (mai 2026) sont restées sans effet.
Cloudflare Workers AI¶
✅ Vérifié — grille tarifaire officielle.
10 000 neurones par jour, tous modèles confondus, sans carte bancaire.
La conversion en tokens dépend du modèle — voir le vocabulaire des quotas pour le calcul détaillé. Ordre de grandeur : de ~49 000 tokens de sortie par jour sur Llama 3.1 70B à ~548 000 sur Llama 3.2 1B 🧮.
Catalogue partiel 📋 : @cf/openai/gpt-oss-120b, @cf/openai/gpt-oss-20b,
@cf/moonshotai/kimi-k2.6, @cf/moonshotai/kimi-k2.7-code,
@cf/zai-org/glm-5.2, @cf/zai-org/glm-4.7-flash,
@cf/nvidia/nemotron-3-120b-a12b, @cf/google/gemma-4-26b-a4b-it,
@cf/qwen/qwen3-30b-a3b-fp8, @cf/ibm-granite/granite-4.0-h-micro, Llama 3.x
et 4 Scout, Mistral Small 3.1, Qwen 2.5 Coder 32B, QwQ 32B.
Verdict : le catalogue le plus à jour parmi les offres sans inscription lourde. L'unité « neurone » complique l'estimation, mais le quota est suffisamment large pour un usage personnel sur modèles moyens.
Cohere¶
✅ Vérifié — docs.cohere.com/docs/rate-limits.
Clés d'essai (trial keys), gratuites et permanentes :
| Endpoint | Limite |
|---|---|
| Chat | 20 requêtes/minute |
| Toutes API confondues | 1 000 appels par mois |
| Embed (texte) | 2 000 entrées/minute |
| Embed (images) | 5 entrées/minute |
| Rerank | 10 requêtes/minute |
| Transcription audio | 5 requêtes/minute |
Modèles 📋 : command-a-plus-05-2026, command-a-03-2025,
command-a-reasoning-08-2025, command-a-translate-08-2025,
command-a-vision-07-2025, command-r-08-2024, command-r-plus-08-2024,
command-r7b-12-2024, command-r7b-arabic-02-2025, c4ai-aya-expanse-32b,
c4ai-aya-vision-32b.
1 000 appels par mois, tous modèles confondus
C'est le plafond réel, et il est bas : environ 33 appels par jour. Pour un agent de code qui enchaîne les allers-retours, c'est épuisé en une seule session de travail.
OpenRouter¶
✅ Vérifié — documentation des limites.
| Condition | RPM | RPD |
|---|---|---|
| Compte sans achat | 20 | 50 |
| Après un dépôt cumulé de 10 $ | 20 | 1 000 |
Quota partagé entre tous les modèles :free.
Deux conditions faciles à manquer :
- le solde du compte doit être positif ou nul — un solde négatif renvoie
402 Payment Requiredmême sur les modèles gratuits ; - multiplier les comptes ou les clés ne sert à rien : « we govern capacity globally ».
Modèles :free au 29 juillet 2026 📋 : Nemotron 3 Ultra 550B A55B, Nemotron 3
Super 120B A12B, Nemotron 3 Nano 30B A3B, Nemotron Nano 12B v2 VL, Nemotron Nano
9B v2, Nemotron 3.5 Content Safety, Poolside Laguna S 2.1, Poolside Laguna XS
2.1, Cohere North Mini Code, Ling 3.0 Flash, Gemma 4 31B, Gemma 4 26B A4B,
openai/gpt-oss-20b.
Le dépôt de 10 $ est le meilleur rapport qualité/prix du marché
Un versement unique de 10 $ multiplie le quota quotidien par vingt, de façon permanente. OmniRoute chiffre ce gain à environ +24 M tokens/mois. Pour qui utilise sérieusement les modèles gratuits, c'est le seul euro dépensé qui se justifie sans discussion.
Hugging Face Inference Providers¶
📋 0,10 $ de crédits par mois, renouvelés. Routage vers plusieurs fournisseurs partenaires.
Estimation 🧮 : de l'ordre de 200 000 tokens/mois selon le modèle choisi.
L'inférence sans serveur est limitée aux modèles de moins de 10 Go, avec des exceptions pour certains modèles populaires. Le tier a été fortement resserré mi-2025 : il était auparavant présenté comme un accès libre à des milliers de modèles.
Z.AI (Zhipu)¶
📋 + sources concordantes. Gratuit en permanence, sans carte.
Modèles gratuits : GLM-4.7-Flash (200 K de contexte), GLM-4.5-Flash, GLM-4.6V-Flash, GLM-4-Flash.
Aucun plafond de tokens publié. La limite documentée est 1 requête simultanée sur le tier gratuit. Un bonus d'inscription d'environ 20 M tokens est également signalé.
Endpoints : https://open.bigmodel.cn/api/paas/v4 (Chine) ou
https://api.z.ai/api/paas/v4 (international).
Verdict : un des rares vrais « gratuits illimités ». La contrainte de concurrence à 1 le rend inadapté au parallélisme, mais parfait pour un usage séquentiel.
Kilo Gateway¶
📋 Passerelle compatible OpenAI. Les modèles gratuits fonctionnent sans compte.
Limite : 200 requêtes/heure par adresse IP, partagées entre tous les modèles gratuits.
Vos prompts servent à l'entraînement
La documentation Kilo indique que tous les modèles gratuits peuvent utiliser vos prompts pour l'entraînement. À proscrire pour du code propriétaire.
Modèles 📋 : Nemotron 3 Ultra / Super / Nano Omni, Nemotron 3.5 Content Safety,
StepFun Step 3.7 Flash, Poolside Laguna S/XS 2.1, Cohere North Mini Code,
Ling 3.0 Flash, plus deux routeurs (Kilo Auto Free, OpenRouter Free Models).
OpenCode Zen¶
📋 Passerelle à catalogue restreint et rotatif, inscription requise, sans plafond de tokens publié. Les données peuvent être utilisées pour l'amélioration du service.
Modèles au 29 juillet 2026 : Big Pickle, DeepSeek V4 Flash Free, MiMo-V2.5 Free, Laguna S 2.1 Free, Ling-3.0-flash Free, North Mini Code Free, Nemotron 3 Ultra Free.
Vercel AI Gateway¶
📋 5 $ par mois de crédits, routés vers plusieurs fournisseurs. Le tier gratuit ne couvre qu'un sous-ensemble du catalogue, avec des limites de débit par modèle.
C'est, en valeur monétaire, le crédit récurrent le plus généreux de la liste — cinquante fois celui de Hugging Face.
SambaNova¶
📋 Tier gratuit permanent et crédit d'inscription de 5 $ valable 3 mois.
Tier permanent : 20 RPM · 20 requêtes/jour · 200 000 tokens/jour.
Modèles : deepseek-v3.1, deepseek-v3.2, gemma-4-31b-it, gpt-oss-120b,
meta-llama-3.3-70b-instruct, minimax-m2.7.
20 requêtes par jour
La limite quotidienne en requêtes est la vraie contrainte : 200 000 tokens/jour répartis sur 20 appels seulement, soit 10 000 tokens par appel en moyenne. C'est bien pour de longs traitements uniques, mauvais pour du conversationnel.
OVHcloud AI Endpoints¶
📋 Inscription requise. 2 requêtes/minute en accès anonyme, plus élevé avec un compte. 14 modèles gratuits, contexte jusqu'à 262 K.
Modèles cités : Qwen3.5-397B-A17B, Qwen3.6-27B, Meta-Llama-3.3-70B-Instruct.
Intérêt particulier : hébergement en Europe, ce qui règle une partie des questions de résidence des données.
Autres tiers gratuits recensés 📋¶
Signalés par freellm.net (3 août 2026), non vérifiés à la source pour ce
rapport :
| Fournisseur | Limite annoncée | Note |
|---|---|---|
| ModelScope | 2 000 requêtes/jour au total | Qwen3.5, MiniMax-M2.5, DeepSeek |
| Ollama Cloud | Limites par session et par semaine | ~20 M tokens/mois estimés |
| LLM7.io | 30 RPM (120 avec jeton) | ~5 M tokens/jour documentés |
| Aion Labs | 15 RPM, 20 000 tokens/jour | Modèles Aion 2.x |
| SiliconFlow | 30 RPM, 60 000 TPM | Modèles $0 permanents |
| Agnes AI | 30 RPM | Contexte 256 K |
| Nscale | Usage raisonnable | Llama 3.3 70B, R1 Distill |
| Glhf.chat | « illimité » sur modèles gratuits | Non vérifié |
| Baidu ERNIE | Non publiée | ERNIE Speed / Lite / Tiny |
| Tencent Hunyuan | Non publiée | Hunyuan-lite, gratuit depuis mai 2024 |
| Requesty | Non publiée | GPT-OSS 120B, Nemotron |
Chapitre suivant : Crédits offerts à l'inscription