Auto-hébergement ou API¶
Le calcul honnête — et les raisons d'héberger soi-même qui n'ont rien à voir avec le coût.
La question¶
Un modèle de 27 milliards de paramètres tient sur une carte. La tentation est immédiate : pourquoi payer une API ?
La réponse dépend de trois choses — le volume, la nature des données, et ce qu'on est prêt à faire tourner soi-même.
Le coût de l'auto-hébergement¶
Trois postes, tous sous-estimés dans les comparaisons courantes.
Le matériel¶
| Configuration | Prix indicatif 2026 | Ce qu'elle permet |
|---|---|---|
| RTX 4090 24 Go | ~2 000 € | 4 bits, ~115 600 jetons |
| RTX 5090 32 Go | ~3 000 € | 4 bits, ~225 500 jetons — mais FP8 inutilisable |
| RTX Pro 6000 / L40S 48 Go | ~8 000 € | FP8, fenêtre native complète |
| H100 80 Go | ~30 000 € | FP8, ~673 000 jetons, service |
48 Go est le point d'équilibre
C'est la première configuration qui permet le FP8 — format recommandé pour l'agentique — et la fenêtre native de 262 144 jetons.
Détail : L'arithmétique de la VRAM.
Ces prix ne comprennent ni la machine, ni l'alimentation, ni le refroidissement, ni la redondance.
L'exploitation¶
C'est le poste que les comparaisons oublient systématiquement :
- installation et mise à jour du moteur d'inférence ;
- réglage du parallélisme, du cache et de la longueur maximale ;
- surveillance, redémarrages, gestion de la mémoire ;
- suivi des nouvelles quantifications et des correctifs ;
- la personne qui fait tout cela.
Le coût dominant n'est pas le GPU
Un ingénieur qui consacre un jour par mois à l'exploitation coûte plus cher, sur l'année, que la plupart des factures d'API des projets de taille moyenne.
L'électricité¶
Une carte à 350 W en service continu consomme environ 3 MWh par an. À 0,20 € le kWh, cela fait 600 €, hors refroidissement.
Le coût de l'API¶
Pour référence, Qwen3.8-Max :
| Poste | Tarif par million de jetons |
|---|---|
| Entrée | 2,00 $ |
| Sortie | 6,00 $ |
| Cache implicite | 0,25 $ |
Un modèle de la classe 27 G, chez un fournisseur d'agrégation, coûte typiquement un ordre de grandeur de moins — de l'ordre de 0,10 à 0,40 $ le million de jetons.
Le calcul de bascule¶
Prenons une configuration à 8 000 € amortie sur trois ans, plus 600 € d'électricité et 2 jours d'ingénieur par an :
Face à un tarif d'API de 0,25 $ le million de jetons mélangés, le seuil de bascule se situe autour de :
soit environ 1,5 milliard de jetons par mois.
Ce volume est très élevé
1,5 milliard de jetons par mois représente, en ordre de grandeur, un service traitant des dizaines de milliers de requêtes longues par jour, en continu.
En dessous, l'API coûte moins cher — et vous n'exploitez rien.
Et le calcul est encore optimiste
Il suppose la carte utilisée en continu. En pratique, une charge présente huit heures par jour et absente le reste du temps divise le dénominateur par trois : le seuil monte d'autant.
Un GPU qui attend coûte le même prix qu'un GPU qui travaille.
Les vraies raisons d'héberger soi-même¶
Aucune n'est le coût.
1. La confidentialité¶
Des données de santé, juridiques, industrielles ou personnelles qui ne doivent pas quitter votre infrastructure. C'est la raison la plus fréquente et la plus solide.
2. La réglementation¶
Certaines juridictions et certains secteurs imposent la localisation des traitements. Ce n'est pas négociable, et cela justifie n'importe quel coût.
3. La latence¶
Une API ajoute un aller-retour réseau. Sur un usage interactif à très fort volume de requêtes courtes, l'exécution locale peut être plus réactive.
4. L'absence de dépendance¶
Un fournisseur peut modifier son modèle, changer ses tarifs, restreindre son accès ou disparaître. Un modèle hébergé localement ne bouge plus.
Ce que la publication des poids garantit vraiment
C'est là le sens du modèle ouvert. Pas l'économie : la permanence et le contrôle.
5. L'affinage¶
Adapter le modèle à un domaine ou à un format propre demande d'avoir les poids. Un modèle de 27 G s'affine sur un budget réaliste — c'est l'un des principaux attraits de cette taille, et la licence Apache 2.0 lève tout obstacle juridique à la redistribution du modèle dérivé.
Une réserve : il n'y a pas de modèle de base
Seule la version instruite est publiée. Un affinage part donc d'un tronc déjà aligné, ce qui contraint davantage qu'un modèle de base neutre.
C'est le même choix que pour le Max. Voir Ce qui reste non publié.
6. L'expérimentation sans compteur¶
Pouvoir lancer mille essais sans surveiller une facture change la manière de travailler. C'est difficile à chiffrer, et réel.
Le tableau de décision¶
| Votre situation | Recommandation |
|---|---|
| Prototypage, faible volume | API |
| Volume moyen, données non sensibles | API |
| Données sensibles ou réglementées | auto-hébergement |
| Besoin d'affinage | auto-hébergement |
| Plus de 1,5 milliard de jetons par mois, charge continue | auto-hébergement |
| Développement personnel, apprentissage | auto-hébergement — le coût est du plaisir |
| « Pour économiser » | API, sauf volume exceptionnel |
Une troisième voie¶
Entre les deux extrêmes, plusieurs fournisseurs hébergent les modèles ouverts sur leur infrastructure.
| Auto-hébergement | Fournisseur tiers | API du constructeur | |
|---|---|---|---|
| Contrôle du modèle | total | le modèle exact | aucun |
| Exploitation | à votre charge | déléguée | déléguée |
| Confidentialité | maximale | contractuelle | contractuelle |
| Coût | élevé à faible volume | faible | faible |
| Permanence | garantie | dépend du fournisseur | aucune |
Pour beaucoup de projets, l'hébergement par un tiers d'un modèle ouvert est le bon compromis : on garde la possibilité de migrer ou d'internaliser, sans exploiter d'infrastructure.
À retenir¶
Ce chapitre en cinq points
- Le seuil de bascule se situe vers 1,5 milliard de jetons par mois, en charge continue.
- Le coût dominant de l'auto-hébergement est l'exploitation, pas le GPU.
- Les vraies raisons sont confidentialité, réglementation, affinage, permanence — jamais le coût.
- Un GPU qui attend coûte autant qu'un GPU qui travaille.
- L'hébergement d'un modèle ouvert par un tiers est souvent le meilleur compromis.
Partie suivante : Analyse critique.