Aller au contenu

Le décodage spéculatif, de 2018 à DSpark

Un modèle de langage produit son texte un jeton à la fois. Pour chaque jeton, la machine relit l'intégralité des poids du modèle depuis la mémoire de la carte graphique. Générer mille mots, c'est donc relire des centaines de gigaoctets — pour un travail de calcul dérisoire à chaque étape.

Le décodage spéculatif (speculative decoding) est la famille de méthodes qui casse cette contrainte : un petit module écrit un brouillon de plusieurs jetons d'un coup, et le grand modèle les vérifie tous en une seule passe. Quand le brouillon est bon, on encaisse plusieurs jetons pour le prix d'un. Quand il est mauvais, on jette et on recommence — mais le texte final reste statistiquement identique à ce qu'aurait produit le modèle seul.

Ce document explique le mécanisme, retrace la lignée des méthodes depuis 2018, puis détaille DSpark, publié par DeepSeek le 6 juillet 2026.

Objectif

Permettre de lire un rapport technique moderne (DeepSeek-V4, Qwen, Llama) sans buter sur « MTP », « EAGLE-3 » ou « longueur acceptée », et savoir estimer ce qu'une accélération annoncée vaut réellement.

Public visé et prérequis

Lecteur qui sait ce qu'est un modèle de langage et un jeton (token). Aucune connaissance de l'inférence GPU n'est supposée : le chapitre 1 pose tout le vocabulaire, y compris la seule formule de probabilité utilisée dans le document.

Temps de lecture : 35 à 45 minutes. Niveau : débutant → intermédiaire.

Parcours de lecture

Les quatre chapitres se lisent dans l'ordre.

  1. Le principe — pourquoi la génération est lente, ce qu'est un brouillon vérifié, pourquoi le résultat est exact, et la formule qui dit combien on gagne.
  2. Avant DSpark : huit ans de méthodes — de Stern (2018) à DFlash (2026), avec ce que chaque étape a apporté.
  3. DSpark — le brouillon semi-autorégressif, la tête de confiance, la vérification à longueur variable, et les chiffres publiés.
  4. Comparaison et limites — tableau récapitulatif, choix pratique, et ce que les gains annoncés ne disent pas.

Les références sont regroupées dans les sources, et rappelées au plus près des affirmations qu'elles soutiennent.

Avertissement méthodologique

Les chiffres de performance de DSpark proviennent de son article et du billet d'intégration SGLang, c'est-à-dire de ses auteurs et de ses intégrateurs. Aucune évaluation indépendante n'était publiée à la date de rédaction. Le chapitre 4 explique lesquels sont robustes et lesquels dépendent fortement des conditions de mesure.


Créé le 8 septembre 2026 · Sources principales : arXiv 2607.05147 (DSpark), arXiv 2602.06036 (DFlash), arXiv 2503.01840 (EAGLE-3), arXiv 2211.17192 (décodage spéculatif).