Sources¶
Sources primaires — DSpark¶
- DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation, Cheng, Yu, Shao et al. (DeepSeek), arXiv 2607.05147, 6 juillet 2026 — https://arxiv.org/abs/2607.05147 Architecture, formule de la cible de confiance, algorithme d'ordonnancement, tableaux de résultats, ablations et limites du chapitre 3.
- Points de contrôle DeepSeek-V4-Pro-DSpark et DeepSeek-V4-Flash-DSpark (licence MIT) et dépôt d'entraînement DeepSpec, publiés par DeepSeek.
Sources primaires — méthodes antérieures¶
- Stern, Shazeer, Uszkoreit, Blockwise Parallel Decoding for Deep Autoregressive Models, 2018.
- Leviathan, Kalman, Matias, Fast Inference from Transformers via Speculative Decoding, arXiv 2211.17192 — https://arxiv.org/abs/2211.17192 Origine de la règle d'acceptation-rejet exposée au chapitre 1.
- Chen et al. (DeepMind), Accelerating Large Language Model Decoding with Speculative Sampling, arXiv 2302.01318.
- Miao et al., SpecInfer, arXiv 2305.09781 — vérification en arbre.
- Cai et al., Medusa, arXiv 2401.10774 — têtes parallèles indépendantes.
- Li et al., EAGLE, arXiv 2401.15077 ; EAGLE-2, arXiv 2406.16858 ; EAGLE-3, arXiv 2503.01840 — https://arxiv.org/abs/2503.01840
- Fu et al., Lookahead Decoding, arXiv 2402.02057.
- Cheng et al. (Apple), ReDrafter, arXiv 2403.09919.
- Elhoushi et al. (Meta), LayerSkip, arXiv 2404.16710.
- DeepSeek-AI, DeepSeek-V3 Technical Report, arXiv 2412.19437 — prédiction multi-jetons (MTP), baseline de DSpark.
- DFlash: Block Diffusion for Flash Speculative Decoding, arXiv 2602.06036, ICML 2026 — https://arxiv.org/abs/2602.06036 Tronc parallèle et injection KV réutilisés par DSpark.
Intégrations moteur¶
- LMSYS Org, DSpark in SGLang: Speculative Decoding with Confidence-Driven, Variable-Length Verification, 6 juillet 2026 — https://www.lmsys.org/blog/2026-07-06-dspark-sglang/ Chiffres de débit (383,7 jetons/s à lot 1 sur V4-Pro), budgets de vérification observés, graphes CUDA « ragged ».
- LMSYS Org, The next generation of speculative decoding: DFlash and Spec V2, 15 juin 2026 — https://www.lmsys.org/blog/2026-06-15-next-generation-speculative-decoding-dflash-v2/ Taxonomie drafters séquentiels / parallèles.
- NVIDIA NeMo AutoModel, Train a DSpark Drafter for Speculative Decoding — https://docs.nvidia.com/nemo/automodel/recipes-e2e-examples/dspark-speculative-decoding
Sources de contexte¶
- DeepLearning.AI, The Batch — DeepSeek Open Sourced A Speculative Decoding Module That Speeds Up Text Generation Without Losing Accuracy — https://www.deeplearning.ai/the-batch/deepseeks-dspark-gains-velocity/ Reprise journalistique ; les chiffres qu'elle avance proviennent de DeepSeek.
- Xia et al., Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding, arXiv 2401.07851 — synthèse de la période 2018–2024.
Statut des chiffres cités
Aucune évaluation indépendante de DSpark n'était publiée à la date de rédaction (8 septembre 2026). Tous les gains rapportés dans ce document proviennent de ses auteurs ou de ses intégrateurs. Voir le chapitre 4 pour la lecture critique.