Aller au contenu

Sources

Sources primaires — DSpark

  • DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation, Cheng, Yu, Shao et al. (DeepSeek), arXiv 2607.05147, 6 juillet 2026 — https://arxiv.org/abs/2607.05147 Architecture, formule de la cible de confiance, algorithme d'ordonnancement, tableaux de résultats, ablations et limites du chapitre 3.
  • Points de contrôle DeepSeek-V4-Pro-DSpark et DeepSeek-V4-Flash-DSpark (licence MIT) et dépôt d'entraînement DeepSpec, publiés par DeepSeek.

Sources primaires — méthodes antérieures

  • Stern, Shazeer, Uszkoreit, Blockwise Parallel Decoding for Deep Autoregressive Models, 2018.
  • Leviathan, Kalman, Matias, Fast Inference from Transformers via Speculative Decoding, arXiv 2211.17192 — https://arxiv.org/abs/2211.17192 Origine de la règle d'acceptation-rejet exposée au chapitre 1.
  • Chen et al. (DeepMind), Accelerating Large Language Model Decoding with Speculative Sampling, arXiv 2302.01318.
  • Miao et al., SpecInfer, arXiv 2305.09781 — vérification en arbre.
  • Cai et al., Medusa, arXiv 2401.10774 — têtes parallèles indépendantes.
  • Li et al., EAGLE, arXiv 2401.15077 ; EAGLE-2, arXiv 2406.16858 ; EAGLE-3, arXiv 2503.01840 — https://arxiv.org/abs/2503.01840
  • Fu et al., Lookahead Decoding, arXiv 2402.02057.
  • Cheng et al. (Apple), ReDrafter, arXiv 2403.09919.
  • Elhoushi et al. (Meta), LayerSkip, arXiv 2404.16710.
  • DeepSeek-AI, DeepSeek-V3 Technical Report, arXiv 2412.19437 — prédiction multi-jetons (MTP), baseline de DSpark.
  • DFlash: Block Diffusion for Flash Speculative Decoding, arXiv 2602.06036, ICML 2026 — https://arxiv.org/abs/2602.06036 Tronc parallèle et injection KV réutilisés par DSpark.

Intégrations moteur

Sources de contexte

  • DeepLearning.AI, The Batch — DeepSeek Open Sourced A Speculative Decoding Module That Speeds Up Text Generation Without Losing Accuracy — https://www.deeplearning.ai/the-batch/deepseeks-dspark-gains-velocity/ Reprise journalistique ; les chiffres qu'elle avance proviennent de DeepSeek.
  • Xia et al., Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding, arXiv 2401.07851 — synthèse de la période 2018–2024.

Statut des chiffres cités

Aucune évaluation indépendante de DSpark n'était publiée à la date de rédaction (8 septembre 2026). Tous les gains rapportés dans ce document proviennent de ses auteurs ou de ses intégrateurs. Voir le chapitre 4 pour la lecture critique.