Aller au contenu

Utilisation

Cette partie couvre ce qu'il faut savoir pour se servir concrètement du modèle : le format de prompt, l'exécution locale et les contraintes matérielles.

Ce que vous allez apprendre

  • Le format de prompt — les jetons spéciaux, le format DSML d'appel d'outils, le mode réflexion, l'effort de raisonnement, et les trois changements par rapport à DeepSeek-V4.
  • Inférence locale — l'implémentation de référence publiée, la conversion des poids, la reproduction des évaluations.
  • Matériel et coûts — ce que 552 G de paramètres exigent réellement.
  • L'API et ses tarifs — le prix, les limites, le calendrier de bascule. La seule traduction chiffrée du gain de cache.

À savoir immédiatement

Pas de gabarit de chat Jinja

Cette version ne fournit pas de gabarit de chat au format Jinja, contrairement à l'usage établi sur Hugging Face. Le format de prompt est fourni sous forme d'une implémentation Python de référence autonome (encoding/encoding.py), accompagnée de cas de test.

Pour la production, DeepSeek publie séparément deepseek-recipe, un ensemble de bibliothèques Rust avec liaisons Python.

Paramètres d'échantillonnage recommandés

Paramètre Valeur
temperature 1,0
top_p 0,95 ou 1,0
context_window 1 M de jetons
max_tokens ≥ 256 K (plafond de l'API : 384 K)

Un max_tokens d'au moins 256 000 est une recommandation inhabituelle. Elle s'explique par les trajectoires agentiques longues et par l'effort de raisonnement élevé : à l'effort 100, la réponse moyenne sur MathArena Apex fait déjà 86 000 jetons.


Partie précédente : Évaluations