Aller au contenu

Coûts

Le tarif affiché, ce qu'il cache, et le seul chiffre qui compte vraiment.


Le tarif

Poste Tarif par million de jetons
Entrée 2,00 $
Sortie 6,00 $
Entrée relue depuis le cache implicite 0,25 $
Création de cache explicite 2,50 $
Lecture depuis un cache explicite 0,17 $

Un tarif unique sur toute la fenêtre d'un million de jetons : pas de palier selon la longueur du contexte, contrairement à plusieurs concurrents qui doublent leur tarif au-delà de 200 000 jetons.

C'est aussi une baisse par rapport à Qwen3.7-Max, facturé 2,50 $ / 7,50 $.


Ce que le tarif cache

Les jetons de raisonnement sont facturés au tarif de sortie

L'effort par défaut est xhigh. Le budget de raisonnement monte à 262 144 jetons.

Une question dont la réponse visible fait 500 jetons peut en consommer 30 000 de raisonnement. À 6 $ le million, la requête coûte 0,18 $ au lieu des 0,003 $ que le calcul naïf suggère — un facteur 60.

C'est la raison pour laquelle le tarif affiché est trompeur, et pour laquelle le seul chiffre exploitable est le coût par tâche mesuré.


Le coût réel

Artificial Analysis mesure, sur son ensemble standard :

Mesure Valeur Rang
Prix mélangé (ratio 7:2:1) 1,18 $ / M —
Coût par tâche 1,13 $ 58ᵉ / 184

1,13 $ par tâche, c'est bon sans être exceptionnel

Le 58ᵉ rang sur 184 place le modèle dans le premier tiers, pas dans le peloton de tête.

Un modèle dont le tarif affiché est trois fois plus élevé mais qui réfléchit cinq fois moins revient moins cher. Le tarif affiché ne classe pas les modèles ; le coût par tâche, si.


Les trois leviers d'optimisation

1. Baisser l'effort de raisonnement

Le levier de loin le plus efficace.

extra_body={"reasoning_effort": "medium"}   # au lieu de "xhigh"
Effort Ordre de grandeur du coût relatif Adapté à
low ×0,1 extraction, classification, reformulation
medium ×0,3 usage général
xhigh ×1 agentique longue, problèmes difficiles

À faire en premier

Sur la majorité des usages en production, medium divise le coût par trois sans effet mesurable sur la qualité perçue.

Le défaut xhigh sert les benchmarks, pas la facture.

2. Utiliser la mise en cache de préfixe

Situation Économie
Préfixe relu 2 à 3 fois cache implicite : −87 % sur l'entrée
Préfixe relu 4 fois ou plus cache explicite : −91 % sur l'entrée

Le point de bascule entre implicite et explicite se situe autour de quatre relectures — le calcul est détaillé au chapitre précédent.

Sur un agent qui rejoue un contexte de 100 000 jetons à chaque tour pendant 200 tours :

Stratégie Coût d'entrée
Aucun cache \(200 \times 0{,}1 \times 2{,}00 = 40{,}00\) $
Cache implicite \(0{,}20 + 199 \times 0{,}1 \times 0{,}25 = 5{,}18\) $
Cache explicite \(0{,}25 + 200 \times 0{,}1 \times 0{,}17 = 3{,}65\) $

Un facteur 11 entre ne rien faire et bien faire.

3. Utiliser le traitement par lots

Pour tout ce qui n'est pas interactif — évaluation, enrichissement de données, génération de masse — le mode lots offre un tarif réduit contre une latence relâchée.


La comparaison

Modèle Entrée Sortie Cache
Qwen3.7-Max 2,50 $ 7,50 $ —
Qwen3.8-Max 2,00 $ 6,00 $ 0,25 $

Face aux modèles frontière occidentaux de la même période, le positionnement est nettement plus bas — c'est l'argument commercial central du lancement.

Trois réserves avant de conclure à l'économie

  1. La vitesse. 47 jetons/s contre une médiane de 67,7. Sur un usage interactif, ce que vous économisez en dollars, vous le payez en temps d'attente utilisateur.
  2. Le raisonnement verbeux. Il absorbe une partie de l'avantage tarifaire, comme le montre le coût par tâche.
  3. Le nombre de jetons produits. Les modèles Qwen sont réputés produire plus de jetons que la moyenne pour un même travail — une observation rapportée par plusieurs analyses de déploiement, non quantifiée officiellement.

Auto-hébergement contre API

La question revient systématiquement. Le calcul :

Côté API : 1,13 $ par tâche mesurée.

Côté auto-hébergement : au minimum neuf B200 pour la version 4 bits, plus l'infrastructure, plus l'ingénieur qui l'exploite, plus l'électricité.

Le seuil de rentabilité n'existe pratiquement pas

Pour amortir un investissement de plusieurs centaines de milliers d'euros face à un tarif de 2 $/6 $ le million, il faut un volume de jetons que très peu d'organisations atteignent — et une utilisation continue, pas des pics.

À cela s'ajoute que le service d'Alibaba est optimisé par ceux qui ont conçu le modèle ; un déploiement maison atteint rarement le même débit.

L'auto-hébergement de Qwen3.8-Max se justifie par la souveraineté, la confidentialité ou la réglementation — jamais par le coût.


À retenir

Ce chapitre en cinq points

  1. Le tarif est 2 $ / 6 $ par million, unique sur toute la fenêtre, en baisse par rapport à la génération précédente.
  2. Les jetons de raisonnement sont facturés en sortie, et le défaut xhigh peut multiplier la facture par plusieurs dizaines.
  3. Le seul chiffre exploitable est le coût par tâche : 1,13 $, 58ᵉ sur 184.
  4. Les trois leviers sont, dans l'ordre : baisser l'effort, utiliser le cache de préfixe, passer par lots.
  5. L'auto-hébergement ne se justifie jamais par le coût.

Partie suivante : Analyse critique.