Aller au contenu

Tier gratuit permanent

Fournisseurs dont l'offre gratuite se renouvelle. Chiffres au 3 août 2026.


Vue d'ensemble

Fournisseur Carte bancaire Autre condition Limite dominante
Cerebras Non pour le tier gratuit — 1 M tokens/jour
Groq Non — TPD par modèle
Google AI Studio Non Données d'entraînement hors UE/EEE/CH/UK RPD ⚠️
Mistral La Plateforme Non Téléphone + opt-in entraînement ~2 RPS
NVIDIA NIM Non Vérification téléphonique ~40 RPM partagés
Cloudflare Workers AI Non — 10 000 neurones/jour
Cohere Non — 1 000 appels/mois
OpenRouter Non Solde ≥ 0 50 req/jour
Hugging Face Non — 0,10 $/mois
Z.AI / Zhipu Non — 1 requête simultanée
Kilo Gateway Non Aucune (sans compte) 200 req/heure par IP
OpenCode Zen Non Inscription non publiée
Vercel AI Gateway Non — 5 $/mois
SambaNova Non Inscription 20 req/jour
OVHcloud AI Endpoints Non Inscription 2 RPM anonyme

Cerebras

✅ Vérifié — documentation officielle, consultée le 3 août 2026.

Modèle RPM TPM TPH TPD
gpt-oss-120b 5 30 000 1 000 000 1 000 000
zai-glm-4.7 5 30 000 1 000 000 1 000 000
gemma-4-31b 5 30 000 1 000 000 1 000 000

gemma-4-31b accepte en plus 2 images par requête, 4 Mo maximum.

Deux offres à ne pas confondre

Cerebras propose un tier gratuit permanent (le tableau ci-dessus, sans carte) et un crédit de 5 $ valable 30 jours, qui lui exige l'ajout d'un moyen de paiement vérifié. Les pages tarifaires mélangent les deux.

Resserrement en 2026

Le TPM est passé de 60 000 à 30 000 sur les modèles documentés, et la limite de 5 RPM est devenue explicite. Le plafond quotidien de 1 M tokens, lui, est inchangé. Par ailleurs zai-glm-4.7 est annoncé déprécié pour août 2026.

Verdict : le meilleur rapport clarté/générosité de la liste. Un plafond quotidien net, une inférence très rapide, aucune ambiguïté.


Groq

✅ Vérifié — console.groq.com/docs/rate-limits, consultée le 3 août 2026.

Modèle RPM RPD TPM TPD
llama-3.1-8b-instant 30 14 400 6 000 500 000
llama-3.3-70b-versatile 30 1 000 12 000 100 000
openai/gpt-oss-120b 30 1 000 8 000 200 000
openai/gpt-oss-20b 30 1 000 8 000 200 000
openai/gpt-oss-safeguard-20b 30 1 000 8 000 200 000
qwen/qwen3.6-27b 30 1 000 8 000 200 000
groq/compound 30 250 70 000 —
groq/compound-mini 30 250 70 000 —
meta-llama/llama-prompt-guard-2-22m 30 14 400 15 000 500 000
meta-llama/llama-prompt-guard-2-86m 30 14 400 15 000 500 000
whisper-large-v3 20 2 000 — —
whisper-large-v3-turbo 20 2 000 — —
canopylabs/orpheus-v1-english 10 100 1 200 3 600
canopylabs/orpheus-arabic-saudi 10 100 1 200 3 600

Erreur fréquente

La formule « Groq = 30 RPM / 14 400 RPD » circule partout. Elle n'est vraie que pour llama-3.1-8b-instant et les modèles de garde. Tous les modèles intéressants sont à 1 000 RPD, soit quatorze fois moins. OmniRoute identifie explicitement cette confusion comme une erreur de son propre catalogue historique.

Les quotas sont par modèle, pas partagés : vous pouvez consommer 500 000 tokens/jour sur le 8B et 200 000 sur gpt-oss-120b le même jour.

Verdict : excellent pour la vitesse et pour les petits modèles. Les 8 000 TPM sur gpt-oss-120b rendent l'usage en agent de code difficile (un seul appel à gros contexte sature la minute).


Google AI Studio

⚠️ Sources en désaccord. C'est le point le plus incertain de tout le rapport.

Google ne publie plus de table de quotas dans sa documentation : la page officielle sur les limites de débit renvoie désormais au tableau de bord AI Studio de chaque projet, et précise que « les limites indiquées ne sont pas garanties ». Les limites s'appliquent par projet, pas par clé.

Version A — liste cheahjs, générée le 29 juillet 2026 📋

Modèle TPM RPD RPM
Gemini 3.6 / 3.5 / 3 Flash 250 000 20 5
Gemini 3.5 / 3.1 Flash-Lite 250 000 500 15
Gemini 2.5 Flash 250 000 20 5
Gemini 2.5 Flash-Lite 250 000 20 10
Gemini 3.1 / 2.5 Flash TTS 10 000 10 3
Gemini Robotics-ER 1.6 250 000 20 5
Gemma 4 31B / 4 26B A4B 16 000 14 400 30
Gemma 3 (27B / 12B / 4B / 1B) 15 000 14 400 30

Version B — freellm.net, données du 3 août 2026 📋

Modèle RPM RPD
Gemini 3.6 Flash 15 1 500
Gemini 3.5 Flash 15 1 500
Gemini 3.5 Flash-Lite 30 1 500

Version C — sources secondaires, mi-2026

Gemini 3 Flash : 10 RPM, 250 000 TPM, 1 500 RPD.

Que faire de ce désaccord

L'écart entre 20 et 1 500 requêtes/jour est d'un facteur 75. Il change complètement l'utilité du tier gratuit Google.

Éléments de contexte : OmniRoute documente que Google a réduit ses quotas gratuits de 50 à 80 % en décembre 2025, que Gemini 2.0 Flash et 2.0 Flash-Lite ont été arrêtés le 1ᵉʳ juin 2026, et que Gemini 2.5 Pro a quitté le tier gratuit en avril 2026 — le gratuit est désormais famille Flash uniquement. La version A, la plus récente et générée automatiquement depuis les sources Google, est aussi la plus pessimiste, ce qui est cohérent avec une tendance au resserrement. La version B ressemble à un chiffre pré-décembre 2025 non rafraîchi.

Conclusion pratique : n'utilisez aucun de ces chiffres. Ouvrez le tableau de bord de limites d'AI Studio avec votre propre compte — c'est la seule source qui fasse foi, et Google le dit explicitement.

Utilisation de vos données

Hors Royaume-Uni, Suisse, EEE et Union européenne, les données envoyées au tier gratuit sont utilisées pour l'entraînement. C'est la contrepartie explicite de la gratuité.

Point positif à noter : les modèles Gemma (poids ouverts, servis par Google) conservent 14 400 requêtes/jour dans les deux versions. C'est de très loin le quota en requêtes le plus généreux du tier gratuit Google, et il est cohérent entre les sources.


Mistral (La Plateforme)

Le plus gros contributeur en volume de tout l'écosystème.

Conditions ✅ : plan Experiment, gratuit, sans carte bancaire, mais avec vérification par téléphone et acceptation obligatoire de l'utilisation des données pour l'entraînement.

Le chiffre annoncé

~1 000 000 000 tokens/mois (≈ 1 milliard), avec un débit très bas (de l'ordre de 1 à 2 requêtes/seconde selon le modèle).

Provenance : OmniRoute (~1.00B, recherche du 17 juin 2026) et plusieurs sources secondaires de juillet 2026. Non confirmé dans la documentation officielle consultée pour ce rapport — les URL de documentation des limites de débit Mistral renvoient une erreur 404 depuis leur réorganisation.

La nuance importante 📋

La liste cheahjs, générée le 29 juillet 2026, indique que les limites Mistral sont désormais fixées par modèle et par organisation, consultables sur admin.mistral.ai/plateforme/limits, et qu'« en juillet 2026, un nouveau compte gratuit voit entre 25 000 et 20 000 000 tokens/minute et entre 0,03 et 12,5 requêtes/seconde selon le modèle ».

Le milliard est à prendre avec précaution

Ce milliard de tokens/mois représente à lui seul environ deux tiers du total de 1,53 Md agrégé par OmniRoute. C'est aussi le chiffre le moins bien vérifié du corpus, et il ne correspond plus au modèle de tarification décrit par Mistral, qui est passé à des limites négociées par organisation.

Vérifiez votre propre page de limites avant de bâtir quoi que ce soit dessus. Un chiffre annoncé pour l'ensemble d'une flotte n'est pas forcément ce que voit votre compte.

Mistral Codestral (endpoint séparé)

📋 Gratuit, sur abonnement mensuel, vérification téléphonique requise : 30 requêtes/minute, 2 000 requêtes/jour sur le modèle Codestral.


NVIDIA NIM

📋 + sources concordantes. Vérification téléphonique obligatoire.

  • ~40 requêtes/minute, partagées entre tous les modèles de la clé.
  • Pas de plafond de tokens publié.
  • Catalogue très large (123 modèles gratuits selon freellm.net), incluant des modèles récents et de gros contextes (jusqu'à 1 M tokens).
  • Les modèles sont souvent limités en fenêtre de contexte par rapport à leur version native.

L'ancien pool de crédits d'inscription a été supprimé : l'accès est désormais un tier de développement gratuit pur.

Verdict : le meilleur catalogue de modèles récents en gratuit. Les 40 RPM partagés sont la contrainte réelle, et plusieurs demandes d'augmentation sur le forum développeurs NVIDIA (mai 2026) sont restées sans effet.


Cloudflare Workers AI

✅ Vérifié — grille tarifaire officielle.

10 000 neurones par jour, tous modèles confondus, sans carte bancaire.

La conversion en tokens dépend du modèle — voir le vocabulaire des quotas pour le calcul détaillé. Ordre de grandeur : de ~49 000 tokens de sortie par jour sur Llama 3.1 70B à ~548 000 sur Llama 3.2 1B 🧮.

Catalogue partiel 📋 : @cf/openai/gpt-oss-120b, @cf/openai/gpt-oss-20b, @cf/moonshotai/kimi-k2.6, @cf/moonshotai/kimi-k2.7-code, @cf/zai-org/glm-5.2, @cf/zai-org/glm-4.7-flash, @cf/nvidia/nemotron-3-120b-a12b, @cf/google/gemma-4-26b-a4b-it, @cf/qwen/qwen3-30b-a3b-fp8, @cf/ibm-granite/granite-4.0-h-micro, Llama 3.x et 4 Scout, Mistral Small 3.1, Qwen 2.5 Coder 32B, QwQ 32B.

Verdict : le catalogue le plus à jour parmi les offres sans inscription lourde. L'unité « neurone » complique l'estimation, mais le quota est suffisamment large pour un usage personnel sur modèles moyens.


Cohere

✅ Vérifié — docs.cohere.com/docs/rate-limits.

Clés d'essai (trial keys), gratuites et permanentes :

Endpoint Limite
Chat 20 requêtes/minute
Toutes API confondues 1 000 appels par mois
Embed (texte) 2 000 entrées/minute
Embed (images) 5 entrées/minute
Rerank 10 requêtes/minute
Transcription audio 5 requêtes/minute

Modèles 📋 : command-a-plus-05-2026, command-a-03-2025, command-a-reasoning-08-2025, command-a-translate-08-2025, command-a-vision-07-2025, command-r-08-2024, command-r-plus-08-2024, command-r7b-12-2024, command-r7b-arabic-02-2025, c4ai-aya-expanse-32b, c4ai-aya-vision-32b.

1 000 appels par mois, tous modèles confondus

C'est le plafond réel, et il est bas : environ 33 appels par jour. Pour un agent de code qui enchaîne les allers-retours, c'est épuisé en une seule session de travail.


OpenRouter

✅ Vérifié — documentation des limites.

Condition RPM RPD
Compte sans achat 20 50
Après un dépôt cumulé de 10 $ 20 1 000

Quota partagé entre tous les modèles :free.

Deux conditions faciles à manquer :

  • le solde du compte doit être positif ou nul — un solde négatif renvoie 402 Payment Required même sur les modèles gratuits ;
  • multiplier les comptes ou les clés ne sert à rien : « we govern capacity globally ».

Modèles :free au 29 juillet 2026 📋 : Nemotron 3 Ultra 550B A55B, Nemotron 3 Super 120B A12B, Nemotron 3 Nano 30B A3B, Nemotron Nano 12B v2 VL, Nemotron Nano 9B v2, Nemotron 3.5 Content Safety, Poolside Laguna S 2.1, Poolside Laguna XS 2.1, Cohere North Mini Code, Ling 3.0 Flash, Gemma 4 31B, Gemma 4 26B A4B, openai/gpt-oss-20b.

Le dépôt de 10 $ est le meilleur rapport qualité/prix du marché

Un versement unique de 10 $ multiplie le quota quotidien par vingt, de façon permanente. OmniRoute chiffre ce gain à environ +24 M tokens/mois. Pour qui utilise sérieusement les modèles gratuits, c'est le seul euro dépensé qui se justifie sans discussion.


Hugging Face Inference Providers

📋 0,10 $ de crédits par mois, renouvelés. Routage vers plusieurs fournisseurs partenaires.

Estimation 🧮 : de l'ordre de 200 000 tokens/mois selon le modèle choisi.

L'inférence sans serveur est limitée aux modèles de moins de 10 Go, avec des exceptions pour certains modèles populaires. Le tier a été fortement resserré mi-2025 : il était auparavant présenté comme un accès libre à des milliers de modèles.


Z.AI (Zhipu)

📋 + sources concordantes. Gratuit en permanence, sans carte.

Modèles gratuits : GLM-4.7-Flash (200 K de contexte), GLM-4.5-Flash, GLM-4.6V-Flash, GLM-4-Flash.

Aucun plafond de tokens publié. La limite documentée est 1 requête simultanée sur le tier gratuit. Un bonus d'inscription d'environ 20 M tokens est également signalé.

Endpoints : https://open.bigmodel.cn/api/paas/v4 (Chine) ou https://api.z.ai/api/paas/v4 (international).

Verdict : un des rares vrais « gratuits illimités ». La contrainte de concurrence à 1 le rend inadapté au parallélisme, mais parfait pour un usage séquentiel.


Kilo Gateway

📋 Passerelle compatible OpenAI. Les modèles gratuits fonctionnent sans compte.

Limite : 200 requêtes/heure par adresse IP, partagées entre tous les modèles gratuits.

Vos prompts servent à l'entraînement

La documentation Kilo indique que tous les modèles gratuits peuvent utiliser vos prompts pour l'entraînement. À proscrire pour du code propriétaire.

Modèles 📋 : Nemotron 3 Ultra / Super / Nano Omni, Nemotron 3.5 Content Safety, StepFun Step 3.7 Flash, Poolside Laguna S/XS 2.1, Cohere North Mini Code, Ling 3.0 Flash, plus deux routeurs (Kilo Auto Free, OpenRouter Free Models).


OpenCode Zen

📋 Passerelle à catalogue restreint et rotatif, inscription requise, sans plafond de tokens publié. Les données peuvent être utilisées pour l'amélioration du service.

Modèles au 29 juillet 2026 : Big Pickle, DeepSeek V4 Flash Free, MiMo-V2.5 Free, Laguna S 2.1 Free, Ling-3.0-flash Free, North Mini Code Free, Nemotron 3 Ultra Free.


Vercel AI Gateway

📋 5 $ par mois de crédits, routés vers plusieurs fournisseurs. Le tier gratuit ne couvre qu'un sous-ensemble du catalogue, avec des limites de débit par modèle.

C'est, en valeur monétaire, le crédit récurrent le plus généreux de la liste — cinquante fois celui de Hugging Face.


SambaNova

📋 Tier gratuit permanent et crédit d'inscription de 5 $ valable 3 mois.

Tier permanent : 20 RPM · 20 requêtes/jour · 200 000 tokens/jour.

Modèles : deepseek-v3.1, deepseek-v3.2, gemma-4-31b-it, gpt-oss-120b, meta-llama-3.3-70b-instruct, minimax-m2.7.

20 requêtes par jour

La limite quotidienne en requêtes est la vraie contrainte : 200 000 tokens/jour répartis sur 20 appels seulement, soit 10 000 tokens par appel en moyenne. C'est bien pour de longs traitements uniques, mauvais pour du conversationnel.


OVHcloud AI Endpoints

📋 Inscription requise. 2 requêtes/minute en accès anonyme, plus élevé avec un compte. 14 modèles gratuits, contexte jusqu'à 262 K.

Modèles cités : Qwen3.5-397B-A17B, Qwen3.6-27B, Meta-Llama-3.3-70B-Instruct.

Intérêt particulier : hébergement en Europe, ce qui règle une partie des questions de résidence des données.


Autres tiers gratuits recensés 📋

Signalés par freellm.net (3 août 2026), non vérifiés à la source pour ce rapport :

Fournisseur Limite annoncée Note
ModelScope 2 000 requêtes/jour au total Qwen3.5, MiniMax-M2.5, DeepSeek
Ollama Cloud Limites par session et par semaine ~20 M tokens/mois estimés
LLM7.io 30 RPM (120 avec jeton) ~5 M tokens/jour documentés
Aion Labs 15 RPM, 20 000 tokens/jour Modèles Aion 2.x
SiliconFlow 30 RPM, 60 000 TPM Modèles $0 permanents
Agnes AI 30 RPM Contexte 256 K
Nscale Usage raisonnable Llama 3.3 70B, R1 Distill
Glhf.chat « illimité » sur modèles gratuits Non vérifié
Baidu ERNIE Non publiée ERNIE Speed / Lite / Tiny
Tencent Hunyuan Non publiée Hunyuan-lite, gratuit depuis mai 2024
Requesty Non publiée GPT-OSS 120B, Nemotron

Chapitre suivant : Crédits offerts à l'inscription