Recommandations pratiques¶
La règle des trois clés¶
Pour la quasi-totalité des usages personnels, trois clés suffisent
| Ordre | Fournisseur | Rôle | Coût |
|---|---|---|---|
| 1 | Cerebras | Cheval de bataille — 1 M tokens/jour, très rapide, quota limpide | 0 € |
| 2 | Groq | Complément rapide — quotas par modèle, non partagés | 0 € |
| 3 | NVIDIA NIM | Modèles récents et gros contextes, ~40 RPM | 0 €, téléphone requis |
| Bonus | OpenRouter + 10 $ | Multiplie le quota par 20, de façon permanente | 10 € une fois |
Aucun routeur n'est nécessaire pour cela : la plupart des clients (Claude Code,
Cursor, Cline, Aider, Continue) acceptent une baseURL et une clé, et tous ces
fournisseurs sont compatibles OpenAI.
Ce que cela vous donne concrètement : de l'ordre de 1,4 à 2,4 millions de tokens par jour, à un débit utilisable, sans dépendance logicielle.
Le meilleur euro dépensé¶
Les 10 $ d'OpenRouter
Un versement unique de 10 $ fait passer le quota des modèles :free de
50 à 1 000 requêtes par jour, définitivement. OmniRoute chiffre ce gain
à +24 M tokens/mois.
C'est, de loin, le meilleur rapport dépense/gain de tout le rapport. Et cela donne accès à des modèles que personne d'autre ne sert gratuitement (Nemotron 3 Ultra 550B, Poolside Laguna, Cohere North Mini Code).
Choisir selon l'usage¶
Agent de code (Claude Code, Cursor, Cline)¶
C'est l'usage le plus exigeant : gros contexte à chaque appel, beaucoup d'allers-retours.
Contrainte dominante : les TPM.
| Rang | Fournisseur | Pourquoi |
|---|---|---|
| 1 | NVIDIA NIM | 40 RPM sans plafond de tokens — le seul débit confortable |
| 2 | Cerebras | 30 000 TPM ≈ 1,5 appel/minute à 20 K de contexte |
| 3 | Kilo Gateway / OpenCode Zen | Modèles orientés code, sans plafond, mais entraînement sur vos prompts |
| ✗ | Cohere | 1 000 appels/mois = une seule session |
| ✗ | Google Flash | 20 requêtes/jour selon la source la plus récente |
| ✗ | SambaNova | 20 requêtes/jour |
Ne mettez pas de code propriétaire chez Mistral, Google, Kilo ou OpenCode Zen
Ces quatre fournisseurs utilisent vos prompts pour l'entraînement — voir Conditions d'utilisation.
Traitement par lot (classification, extraction, résumés)¶
Contrainte dominante : le volume total.
- Mistral Experiment — le volume annoncé est le plus élevé, et le faible débit importe peu sur un traitement asynchrone. Vérifiez votre page de limites.
- Cerebras — 1 M tokens/jour, épuisables en ~33 minutes de traitement continu.
- Groq
llama-3.1-8b-instant— 500 000 tokens/jour, 14 400 requêtes/jour. - Cloudflare Workers AI — excellent sur les petits modèles (~548 000 tokens/jour sur Llama 3.2 1B).
Chatbot ou prototype conversationnel¶
Contrainte dominante : les RPM.
- Groq — 30 RPM, réponses quasi instantanées.
- Z.AI GLM-4.7-Flash — pas de plafond, 200 K de contexte, mais 1 requête simultanée.
- Cloudflare Workers AI — sans inscription lourde.
Données sensibles ou code propriétaire¶
- Cloudflare Workers AI — pas d'opt-in entraînement sur le gratuit.
- OVHcloud AI Endpoints — hébergement européen.
- Modèles locaux (Ollama, LM Studio, llama.cpp) — la seule garantie réelle. Aucun quota, aucune condition d'utilisation, aucune fuite.
L'option la plus sous-estimée
Un modèle de 8 à 30 milliards de paramètres tourne correctement sur une machine grand public récente. Sur du code, un Qwen Coder ou un GPT-OSS 20B local dépasse ce que vous obtiendrez d'un tier gratuit contraint à 20 requêtes par jour — et ne disparaîtra jamais suite à un changement de politique tarifaire.
Quand un routeur devient utile¶
Un agrégateur n'a de sens que si au moins deux de ces conditions sont vraies :
- vous êtes effectivement bloqué par des
429plusieurs fois par jour ; - vous utilisez déjà plus de cinq fournisseurs différents ;
- vous voulez un basculement automatique sans interrompre une session d'agent ;
- vous voulez la compression de contexte (OmniRoute), qui est un gain réel et indépendant des fournisseurs ;
- vous voulez un suivi de consommation consolidé.
Sinon, un routeur ajoute : une dépendance, un processus à maintenir, une surface de configuration, un point de panne unique, et un décalage entre les quotas réels et ceux que le routeur croit connaître.
Si vous en installez un : OmniRoute, en désactivant les fournisseurs « cookie web » et OAuth. Voir Comparaison.
Ce à quoi ne pas s'attendre¶
Cinq illusions à écarter
- « 1,5 milliard de tokens par mois » — vous n'en consommerez jamais une fraction. Le débit vous bloque bien avant le volume.
- « Mon agent ne rencontrera plus de limite » — un routeur déplace la limite, il ne la supprime pas. Quand tous les fournisseurs sont épuisés, vous êtes bloqué.
- « J'ai accès aux modèles de pointe » — non. Aucun tier gratuit ne sert les modèles frontière. Le gratuit, c'est du poids ouvert et des modèles « Flash » ou « Lite ».
- « La qualité est constante » — non. Les deux agrégateurs reconnaissent que l'intelligence effective baisse au fil de la journée, jusqu'à la réinitialisation à minuit UTC.
- « C'est stable » — non. Huit fermetures et dix réductions majeures en douze mois.
En une phrase¶
Prenez Cerebras, Groq et NVIDIA NIM, ajoutez 10 $ chez OpenRouter, gardez un modèle local pour ce qui est sensible, et n'installez un routeur que le jour où vous serez réellement bloqué.
Partie suivante : Annexes