Aller au contenu

Auto-hébergement ou API

Le calcul honnête — et les raisons d'héberger soi-même qui n'ont rien à voir avec le coût.


La question

Un modèle de 27 milliards de paramètres tient sur une carte. La tentation est immédiate : pourquoi payer une API ?

La réponse dépend de trois choses — le volume, la nature des données, et ce qu'on est prêt à faire tourner soi-même.


Le coût de l'auto-hébergement

Trois postes, tous sous-estimés dans les comparaisons courantes.

Le matériel

Configuration Prix indicatif 2026 Ce qu'elle permet
RTX 4090 24 Go ~2 000 € 4 bits, ~115 600 jetons
RTX 5090 32 Go ~3 000 € 4 bits, ~225 500 jetons — mais FP8 inutilisable
RTX Pro 6000 / L40S 48 Go ~8 000 € FP8, fenêtre native complète
H100 80 Go ~30 000 € FP8, ~673 000 jetons, service

48 Go est le point d'équilibre

C'est la première configuration qui permet le FP8 — format recommandé pour l'agentique — et la fenêtre native de 262 144 jetons.

Détail : L'arithmétique de la VRAM.

Ces prix ne comprennent ni la machine, ni l'alimentation, ni le refroidissement, ni la redondance.

L'exploitation

C'est le poste que les comparaisons oublient systématiquement :

  • installation et mise à jour du moteur d'inférence ;
  • réglage du parallélisme, du cache et de la longueur maximale ;
  • surveillance, redémarrages, gestion de la mémoire ;
  • suivi des nouvelles quantifications et des correctifs ;
  • la personne qui fait tout cela.

Le coût dominant n'est pas le GPU

Un ingénieur qui consacre un jour par mois à l'exploitation coûte plus cher, sur l'année, que la plupart des factures d'API des projets de taille moyenne.

L'électricité

Une carte à 350 W en service continu consomme environ 3 MWh par an. À 0,20 € le kWh, cela fait 600 €, hors refroidissement.


Le coût de l'API

Pour référence, Qwen3.8-Max :

Poste Tarif par million de jetons
Entrée 2,00 $
Sortie 6,00 $
Cache implicite 0,25 $

Un modèle de la classe 27 G, chez un fournisseur d'agrégation, coûte typiquement un ordre de grandeur de moins — de l'ordre de 0,10 à 0,40 $ le million de jetons.


Le calcul de bascule

Prenons une configuration à 8 000 € amortie sur trois ans, plus 600 € d'électricité et 2 jours d'ingénieur par an :

\[ \frac{8\,000}{3} + 600 + (2 \times 600) \approx 4\,467\ \text{€ par an} \]

Face à un tarif d'API de 0,25 $ le million de jetons mélangés, le seuil de bascule se situe autour de :

\[ \frac{4\,467}{0{,}25} \approx 17\,900 \text{ millions de jetons par an} \]

soit environ 1,5 milliard de jetons par mois.

Ce volume est très élevé

1,5 milliard de jetons par mois représente, en ordre de grandeur, un service traitant des dizaines de milliers de requêtes longues par jour, en continu.

En dessous, l'API coûte moins cher — et vous n'exploitez rien.

Et le calcul est encore optimiste

Il suppose la carte utilisée en continu. En pratique, une charge présente huit heures par jour et absente le reste du temps divise le dénominateur par trois : le seuil monte d'autant.

Un GPU qui attend coûte le même prix qu'un GPU qui travaille.


Les vraies raisons d'héberger soi-même

Aucune n'est le coût.

1. La confidentialité

Des données de santé, juridiques, industrielles ou personnelles qui ne doivent pas quitter votre infrastructure. C'est la raison la plus fréquente et la plus solide.

2. La réglementation

Certaines juridictions et certains secteurs imposent la localisation des traitements. Ce n'est pas négociable, et cela justifie n'importe quel coût.

3. La latence

Une API ajoute un aller-retour réseau. Sur un usage interactif à très fort volume de requêtes courtes, l'exécution locale peut être plus réactive.

4. L'absence de dépendance

Un fournisseur peut modifier son modèle, changer ses tarifs, restreindre son accès ou disparaître. Un modèle hébergé localement ne bouge plus.

Ce que la publication des poids garantit vraiment

C'est là le sens du modèle ouvert. Pas l'économie : la permanence et le contrôle.

5. L'affinage

Adapter le modèle à un domaine ou à un format propre demande d'avoir les poids. Un modèle de 27 G s'affine sur un budget réaliste — c'est l'un des principaux attraits de cette taille, et la licence Apache 2.0 lève tout obstacle juridique à la redistribution du modèle dérivé.

Une réserve : il n'y a pas de modèle de base

Seule la version instruite est publiée. Un affinage part donc d'un tronc déjà aligné, ce qui contraint davantage qu'un modèle de base neutre.

C'est le même choix que pour le Max. Voir Ce qui reste non publié.

6. L'expérimentation sans compteur

Pouvoir lancer mille essais sans surveiller une facture change la manière de travailler. C'est difficile à chiffrer, et réel.


Le tableau de décision

Votre situation Recommandation
Prototypage, faible volume API
Volume moyen, données non sensibles API
Données sensibles ou réglementées auto-hébergement
Besoin d'affinage auto-hébergement
Plus de 1,5 milliard de jetons par mois, charge continue auto-hébergement
Développement personnel, apprentissage auto-hébergement — le coût est du plaisir
« Pour économiser » API, sauf volume exceptionnel

Une troisième voie

Entre les deux extrêmes, plusieurs fournisseurs hébergent les modèles ouverts sur leur infrastructure.

Auto-hébergement Fournisseur tiers API du constructeur
Contrôle du modèle total le modèle exact aucun
Exploitation à votre charge déléguée déléguée
Confidentialité maximale contractuelle contractuelle
Coût élevé à faible volume faible faible
Permanence garantie dépend du fournisseur aucune

Pour beaucoup de projets, l'hébergement par un tiers d'un modèle ouvert est le bon compromis : on garde la possibilité de migrer ou d'internaliser, sans exploiter d'infrastructure.


À retenir

Ce chapitre en cinq points

  1. Le seuil de bascule se situe vers 1,5 milliard de jetons par mois, en charge continue.
  2. Le coût dominant de l'auto-hébergement est l'exploitation, pas le GPU.
  3. Les vraies raisons sont confidentialité, réglementation, affinage, permanence — jamais le coût.
  4. Un GPU qui attend coûte autant qu'un GPU qui travaille.
  5. L'hébergement d'un modèle ouvert par un tiers est souvent le meilleur compromis.

Partie suivante : Analyse critique.