L'API et ses tarifs¶
Le rapport technique ne dit rien du prix. Toute cette page vient de la documentation d'API et de l'annonce de sortie de DeepSeek, vérifiées le 10 septembre 2026.
Le nom du modèle¶
model: deepseek-flash
Les anciens identifiants deepseek-v4-flash et deepseek-v4-flash-vision-exp
restent acceptés, mais les modèles correspondants sont retirés : leurs
requêtes sont servies par V4.1-Flash et facturées au tarif Flash.
Les tarifs¶
Prix en dollars par million de jetons. Les heures pleines sont 01:00–04:00 et 06:00–10:00 UTC, du lundi au vendredi ; tout le reste est en heures creuses. Le tarif creux vaut exactement la moitié du tarif plein.
deepseek-flash creux |
deepseek-flash plein |
deepseek-v4-pro creux |
|
|---|---|---|---|
| Entrée, cache hit | 0,003 $ | 0,006 $ | 0,022 $ |
| Entrée, cache miss | 0,15 $ | 0,30 $ | 0,66 $ |
| Sortie | 0,60 $ | 1,20 $ | 1,98 $ |
Face à V4-Pro, à tarification équivalente : −86 % sur le cache hit, −77 % sur le cache miss, −70 % sur la sortie.
Le chiffre qui relie l'architecture au prix
0,003 $ par million de jetons d'entrée en cache, soit trois millièmes de dollar. C'est la traduction commerciale directe du cache persistant divisé par huit.
DeepSeek le dit explicitement dans son annonce : « les frais de cache hit représentent souvent une part importante des coûts d'un agent. Compresser le cache réduit ces coûts significativement. »
Tout le rapport technique tient dans cette ligne de facturation : le modèle est conçu pour que relire coûte quasiment rien.
Les limites et capacités¶
| Élément | Valeur |
|---|---|
| Contexte | 1 M jetons |
| Sortie maximale | 384 K jetons |
| Limite de concurrence | 2 500 (contre 500 pour V4-Pro) |
| Mode réflexion | activé par défaut, désactivable |
| Vision | supportée (V4-Pro ne l'était pas) |
| Sortie JSON, appels d'outils | supportés |
| API Responses, API Anthropic | supportées |
| Préfixe de complétion, FIM | bêta, mode sans réflexion uniquement |
Les bases : https://api.deepseek.com au format OpenAI,
https://api.deepseek.com/anthropic au format Anthropic.
La sortie maximale de 384 K jetons
C'est cohérent avec la recommandation max_tokens ≥ 256 K de la carte de
modèle, et avec les longueurs de trajectoire mesurées à l'effort 100 : la
réponse moyenne sur MathArena Apex fait déjà 86 000 jetons. Voir
L'effort de raisonnement.
Le calendrier de bascule¶
| Date (UTC) | Événement |
|---|---|
| 10 septembre 2026, 04:00 | Nouveaux tarifs en vigueur. V4-Flash et V4-Flash-Vision-Exp retirés, leurs identifiants routés vers V4.1-Flash |
| 14 septembre 2026, 04:00 | Toutes les requêtes deepseek-v4-pro sont routées vers V4.1-Flash, au tarif Flash, jusqu'à la sortie de V4.1-Pro |
DeepSeek justifie le second point ainsi : « après des tests extensifs, V4.1 Flash a dépassé V4 Pro de manière exhaustive en performance, coût, vitesse et temps total, donc nous prévoyons de retirer V4 Pro de manière ordonnée. »
Ce que cette phrase implique
Un modèle de 1,6 T de paramètres est mis à la retraite et remplacé par un modèle trois fois plus petit facturé trois fois moins cher. C'est la validation économique de la thèse du rapport technique — et aussi son contexte commercial : la comparaison V4.1 contre V4-Pro n'est pas désintéressée, c'est celle qui justifie le retrait.
L'annonce mentionne aussi un V4.1-Pro à venir, sans date.
Un coût par tâche, estimé¶
DeepSeek ne publie aucun coût par tâche. On peut néanmoins l'encadrer.
Une tâche DeepSWE à effort maximal consomme de l'ordre de 150 à 250 K jetons de sortie, et un volume d'entrée bien supérieur mais très majoritairement en cache hit — c'est la nature même d'une trajectoire d'agent, qui relit sans cesse le même contexte.
À 0,60 $ par million en sortie et 0,003 $ en cache hit, en heures creuses :
soit un ordre de grandeur de 0,10 à 0,20 $ par tâche, la partie entrée étant quasiment négligeable devant elle.
Statut de ce chiffre
C'est une extrapolation, pas une mesure. Elle repose sur une lecture de la figure 7 du rapport pour les volumes de sortie, et suppose un taux de cache hit élevé qui dépend entièrement du harnais et du motif d'usage. Le coût réel d'un déploiement peut en différer d'un facteur plusieurs.
Les options de déploiement¶
L'annonce mentionne un travail avec la communauté open source sur le support d'inférence, et propose un contact direct pour les déploiements « à 2 000 GPU plus une grappe de stockage » — ce qui donne une idée de l'échelle visée.
Les partenaires officiels annoncés comme supportant V4.1-Flash sont WorkBuddy (dont CodeBuddy) et OpenCode.
Côté auto-hébergement, deux configurations sont données comme vérifiées avec SGLang : 4 × GB300 et 4 × MI350X. Les tables Engram peuvent être placées en mémoire hôte, ce qui allège le budget graphique — voir Matériel et coûts.
Statut de ces informations de déploiement
Contrairement aux tarifs, qui viennent de la page officielle de tarification, les configurations SGLang et les variables d'environnement associées n'ont pas été revérifiées à la source pour ce rapport. À reconfirmer avant de dimensionner un déploiement.
Partie suivante : Analyse critique