Utilisation¶
Cette partie couvre ce qu'il faut savoir pour se servir concrètement du modèle : le format de prompt, l'exécution locale et les contraintes matérielles.
Ce que vous allez apprendre¶
- Le format de prompt — les jetons spéciaux, le format DSML d'appel d'outils, le mode réflexion, l'effort de raisonnement, et les trois changements par rapport à DeepSeek-V4.
- Inférence locale — l'implémentation de référence publiée, la conversion des poids, la reproduction des évaluations.
- Matériel et coûts — ce que 552 G de paramètres exigent réellement.
- L'API et ses tarifs — le prix, les limites, le calendrier de bascule. La seule traduction chiffrée du gain de cache.
À savoir immédiatement¶
Pas de gabarit de chat Jinja
Cette version ne fournit pas de gabarit de chat au format Jinja, contrairement
à l'usage établi sur Hugging Face. Le format de prompt est fourni sous forme
d'une implémentation Python de référence autonome (encoding/encoding.py),
accompagnée de cas de test.
Pour la production, DeepSeek publie séparément deepseek-recipe, un ensemble de bibliothèques Rust avec liaisons Python.
Paramètres d'échantillonnage recommandés¶
| Paramètre | Valeur |
|---|---|
temperature |
1,0 |
top_p |
0,95 ou 1,0 |
context_window |
1 M de jetons |
max_tokens |
≥ 256 K (plafond de l'API : 384 K) |
Un max_tokens d'au moins 256 000 est une recommandation inhabituelle. Elle
s'explique par les trajectoires agentiques longues et par l'effort de
raisonnement élevé : à l'effort 100, la réponse moyenne sur MathArena Apex fait
déjà 86 000 jetons.
Partie précédente : Évaluations