Aller au contenu

Recommandations pratiques


La règle des trois clés

Pour la quasi-totalité des usages personnels, trois clés suffisent

Ordre Fournisseur Rôle Coût
1 Cerebras Cheval de bataille — 1 M tokens/jour, très rapide, quota limpide 0 €
2 Groq Complément rapide — quotas par modèle, non partagés 0 €
3 NVIDIA NIM Modèles récents et gros contextes, ~40 RPM 0 €, téléphone requis
Bonus OpenRouter + 10 $ Multiplie le quota par 20, de façon permanente 10 € une fois

Aucun routeur n'est nécessaire pour cela : la plupart des clients (Claude Code, Cursor, Cline, Aider, Continue) acceptent une baseURL et une clé, et tous ces fournisseurs sont compatibles OpenAI.

Ce que cela vous donne concrètement : de l'ordre de 1,4 à 2,4 millions de tokens par jour, à un débit utilisable, sans dépendance logicielle.


Le meilleur euro dépensé

Les 10 $ d'OpenRouter

Un versement unique de 10 $ fait passer le quota des modèles :free de 50 à 1 000 requêtes par jour, définitivement. OmniRoute chiffre ce gain à +24 M tokens/mois.

C'est, de loin, le meilleur rapport dépense/gain de tout le rapport. Et cela donne accès à des modèles que personne d'autre ne sert gratuitement (Nemotron 3 Ultra 550B, Poolside Laguna, Cohere North Mini Code).


Choisir selon l'usage

Agent de code (Claude Code, Cursor, Cline)

C'est l'usage le plus exigeant : gros contexte à chaque appel, beaucoup d'allers-retours.

Contrainte dominante : les TPM.

Rang Fournisseur Pourquoi
1 NVIDIA NIM 40 RPM sans plafond de tokens — le seul débit confortable
2 Cerebras 30 000 TPM ≈ 1,5 appel/minute à 20 K de contexte
3 Kilo Gateway / OpenCode Zen Modèles orientés code, sans plafond, mais entraînement sur vos prompts
✗ Cohere 1 000 appels/mois = une seule session
✗ Google Flash 20 requêtes/jour selon la source la plus récente
✗ SambaNova 20 requêtes/jour

Ne mettez pas de code propriétaire chez Mistral, Google, Kilo ou OpenCode Zen

Ces quatre fournisseurs utilisent vos prompts pour l'entraînement — voir Conditions d'utilisation.

Traitement par lot (classification, extraction, résumés)

Contrainte dominante : le volume total.

  1. Mistral Experiment — le volume annoncé est le plus élevé, et le faible débit importe peu sur un traitement asynchrone. Vérifiez votre page de limites.
  2. Cerebras — 1 M tokens/jour, épuisables en ~33 minutes de traitement continu.
  3. Groq llama-3.1-8b-instant — 500 000 tokens/jour, 14 400 requêtes/jour.
  4. Cloudflare Workers AI — excellent sur les petits modèles (~548 000 tokens/jour sur Llama 3.2 1B).

Chatbot ou prototype conversationnel

Contrainte dominante : les RPM.

  1. Groq — 30 RPM, réponses quasi instantanées.
  2. Z.AI GLM-4.7-Flash — pas de plafond, 200 K de contexte, mais 1 requête simultanée.
  3. Cloudflare Workers AI — sans inscription lourde.

Données sensibles ou code propriétaire

  1. Cloudflare Workers AI — pas d'opt-in entraînement sur le gratuit.
  2. OVHcloud AI Endpoints — hébergement européen.
  3. Modèles locaux (Ollama, LM Studio, llama.cpp) — la seule garantie réelle. Aucun quota, aucune condition d'utilisation, aucune fuite.

L'option la plus sous-estimée

Un modèle de 8 à 30 milliards de paramètres tourne correctement sur une machine grand public récente. Sur du code, un Qwen Coder ou un GPT-OSS 20B local dépasse ce que vous obtiendrez d'un tier gratuit contraint à 20 requêtes par jour — et ne disparaîtra jamais suite à un changement de politique tarifaire.


Quand un routeur devient utile

Un agrégateur n'a de sens que si au moins deux de ces conditions sont vraies :

  • vous êtes effectivement bloqué par des 429 plusieurs fois par jour ;
  • vous utilisez déjà plus de cinq fournisseurs différents ;
  • vous voulez un basculement automatique sans interrompre une session d'agent ;
  • vous voulez la compression de contexte (OmniRoute), qui est un gain réel et indépendant des fournisseurs ;
  • vous voulez un suivi de consommation consolidé.

Sinon, un routeur ajoute : une dépendance, un processus à maintenir, une surface de configuration, un point de panne unique, et un décalage entre les quotas réels et ceux que le routeur croit connaître.

Si vous en installez un : OmniRoute, en désactivant les fournisseurs « cookie web » et OAuth. Voir Comparaison.


Ce à quoi ne pas s'attendre

Cinq illusions à écarter

  1. « 1,5 milliard de tokens par mois » — vous n'en consommerez jamais une fraction. Le débit vous bloque bien avant le volume.
  2. « Mon agent ne rencontrera plus de limite » — un routeur déplace la limite, il ne la supprime pas. Quand tous les fournisseurs sont épuisés, vous êtes bloqué.
  3. « J'ai accès aux modèles de pointe » — non. Aucun tier gratuit ne sert les modèles frontière. Le gratuit, c'est du poids ouvert et des modèles « Flash » ou « Lite ».
  4. « La qualité est constante » — non. Les deux agrégateurs reconnaissent que l'intelligence effective baisse au fil de la journée, jusqu'à la réinitialisation à minuit UTC.
  5. « C'est stable » — non. Huit fermetures et dix réductions majeures en douze mois.

En une phrase

Prenez Cerebras, Groq et NVIDIA NIM, ajoutez 10 $ chez OpenRouter, gardez un modèle local pour ce qui est sensible, et n'installez un routeur que le jour où vous serez réellement bloqué.


Partie suivante : Annexes