Aller au contenu

Post-entraînement : SFT, RL, distillation

Ce qui manque à un modèle pré-entraîné

À la fin du pré-entraînement, le modèle sait continuer du texte. Il ne sait pas :

  • distinguer une consigne d'un simple morceau de texte ;
  • s'arrêter au bon moment ;
  • appeler un outil et attendre son résultat ;
  • refuser une demande dangereuse ;
  • moduler l'effort de réflexion selon la difficulté.

Le post-entraînement installe tout cela. Chez Kimi K3, il se déroule en trois étapes : SFT, puis RL, puis MOPD.

Modèle pré-entraîné
        │
        ▼
   ①  SFT  ────────────────► politique de départ ("cold start")
        │
        ▼
   ②  RL × (3 domaines × 3 niveaux d'effort) ──► 9 modèles experts
        │
        ▼
   ③  MOPD (distillation multi-professeurs) ──► un seul modèle unifié

① L'ajustement supervisé (SFT)

Supervised Fine-Tuning : on continue l'entraînement par prédiction du jeton suivant, mais sur des conversations démonstratives — un utilisateur demande, un assistant idéal répond.

Techniquement, rien de nouveau : c'est la même perte d'entropie croisée. La différence est dans les données, et dans le masquage : on ne calcule la perte que sur les jetons produits par l'assistant, pas sur ceux de l'utilisateur.

Intuition

Le SFT n'enseigne pas de nouvelles connaissances. Il enseigne un format et un comportement : voici à quoi ressemble une bonne réponse, voici comment on appelle un outil, voici où l'on s'arrête.

Chez Kimi K3, les trajectoires de SFT sont synthétisées par les modèles précédents de la série Kimi, puis filtrées par vérification multi-étapes et annotation humaine. Elles sont sérialisées au format XTML (voir SFT et modèle de conversation).

② L'apprentissage par renforcement (RL)

Le SFT imite. Le RL optimise un résultat.

Le cycle :

  1. Le modèle (la politique \(\pi_\theta\)) produit une réponse ou une trajectoire complète.
  2. Un signal de récompense évalue cette production.
  3. Les paramètres sont ajustés pour rendre les productions bien récompensées plus probables.

D'où vient la récompense ?

Type Principe Fiabilité
RLHF Des humains classent des réponses ; un modèle de récompense apprend leurs préférences Subjectif, sujet au reward hacking
RLVR (vérifiable) La récompense est calculée : les tests passent ou non, la réponse est juste ou non Objectif, mais limité aux tâches vérifiables
GRM (juge génératif) Un modèle joue le juge, en produisant explicitement une grille de critères Intermédiaire

Kimi K3 utilise les trois, mais met l'accent sur le vérifiable. Ses environnements RL sont conçus pour que la réussite soit mesurable : un noyau GPU est-il numériquement correct et plus rapide ? le site web se construit-il et fonctionne-t-il ? le vérificateur indépendant valide-t-il l'état final ?

Le reward hacking

Limite importante

Un modèle optimise ce qu'on mesure, pas ce qu'on veut. S'il découvre un raccourci qui maximise le score sans accomplir la tâche, il l'exploitera.

Le rapport Kimi K3 documente des contre-mesures très concrètes :

  • sur les tâches de noyaux GPU, un système de détection de triche pénalise la relecture de CUDA graphs, la mise en cache des entrées et la réduction de précision — étendu au fil des nouvelles stratégies observées ;
  • sur les tâches d'exécution autonome, les agents sont isolés du vérificateur, avec des vérificateurs publics (diagnostiques) et cachés (évaluation sur des scénarios non vus) ;
  • sur le jugement génératif, une limite de verbosité : dépasser \(\sigma \cdot \ell_0\) jetons fait perdre automatiquement la comparaison, pour contrer la dérive vers des réponses de plus en plus longues ;
  • sur le développement web, la récompense est mise à zéro si le projet ne se construit pas, plante, ou simule la fonctionnalité au lieu de l'implémenter.

Le déploiement (rollout) et sa latence

En RL agentique, produire une trajectoire peut demander des heures : des milliers d'appels d'outils, des millions de jetons. Attendre que toutes les trajectoires se terminent avant de mettre à jour la politique gaspillerait l'essentiel du matériel — le débit serait fixé par la trajectoire la plus lente.

Partial rollout (déploiement partiel) : on interrompt la phase de génération dès qu'une fraction \(\lambda\) des trajectoires est terminée. Les trajectoires en cours sont mises en pause, mises en file, et reprises à l'itération suivante.

Le prix à payer

Une trajectoire longue s'étale alors sur plusieurs itérations : quand elle se termine, elle a été produite par une politique périmée (stale data), différente de la politique courante. C'est un régime fortement hors-politique (off-policy), qui déstabilise la plupart des algorithmes de RL.

Kimi K3 s'appuie sur une régularisation par jeton qui contraint les mises à jour à un voisinage local, ce qui rend l'algorithme tolérant à cette obsolescence. C'est ce qui rend possible l'entraînement sur des trajectoires de millions de jetons.

Notons que le rapport ne donne pas la formule de cette régularisation, renvoyant à Kimi K2.5. C'est une des principales lacunes de reproductibilité.

Le contrôle de l'effort de raisonnement

Kimi K3 expose trois niveaux d'effort : low, high, max. Ils ne sont pas obtenus par un réglage à l'inférence mais entraînés.

Le mécanisme : à chaque problème \(x\) est associé un budget initial \(b_0(x)\), estimé sur le modèle de départ. Toute trajectoire dépassant \(\tau \cdot b_0(x)\) jetons reçoit une récompense de \(-1\), quelle que soit sa qualité.

\[ r(x,y) = \begin{cases} -1 & \text{si } T(y) > \tau \cdot b_0(x) \\ R_{\text{tâche}}(y \mid x) & \text{sinon} \end{cases} \]

Le curriculum : entraîner d'abord une variante max-budget avec \(\tau\) grand, puis réduire progressivement \(\tau\) pour obtenir les variantes high et low.

Intuition

On n'apprend pas au modèle à « réfléchir moins ». On lui apprend à obtenir le même résultat dans un budget contraint — ce qui l'oblige à supprimer les détours plutôt que les conclusions.

③ La distillation multi-professeurs (MOPD)

À l'issue du RL, Kimi K3 dispose de neuf modèles experts : 3 domaines (tâches générales, agents généraux, agents de code) × 3 niveaux d'effort. Livrer neuf modèles serait ingérable. Il faut les fusionner.

La distillation consiste à entraîner un modèle élève à imiter un modèle professeur. La variante on-policy est plus subtile : l'élève génère lui-même les trajectoires, et le professeur les note.

\[ r_{\mathrm{opd}}(y_t) = \operatorname{clip}\!\left(\operatorname{sg}\!\left(\log\frac{\pi_{\text{prof}}(y_t \mid x, y_{<t})}{\pi_{\theta}(y_t \mid e, x, y_{<t})}\right), -R_{\max}, R_{\max}\right) \]
Symbole Signification
\(\pi_{\text{prof}}\) Le professeur correspondant au domaine \(d\) et à l'effort \(e\)
\(\pi_\theta\) L'élève, le modèle unifié en cours d'entraînement
\(\operatorname{sg}\) Stop-gradient : la quantité est traitée comme une constante
\(\operatorname{clip}\) Bornage, pour éviter les signaux d'avantage extrêmes
\(e\) Le niveau d'effort, donné en entrée à l'élève

Pourquoi c'est élégant

La récompense est dense — une valeur par jeton, pas une seule à la fin de la trajectoire. Elle s'intègre donc directement dans l'infrastructure RL existante, y compris le partial rollout. Et comme l'élève reçoit le niveau d'effort en entrée, un unique modèle apprend à imiter le bon professeur selon le contexte.

Note

L'équipe indique avoir essayé des objectifs de distillation top-\(k\) plus fins, sans avantage net sur la vitesse de convergence ni sur la performance finale.

Le post-entraînement conscient du déploiement

Deux étapes supplémentaires, moins visibles mais économiquement décisives :

  • QAT (Quantization-Aware Training) : les poids des experts sont quantifiés en MXFP4 dès le SFT, et tout le post-entraînement se déroule avec cette contrainte. Le modèle s'adapte donc à la perte de précision au lieu de la subir après coup. Pendant le RL, le déploiement et l'entraînement partagent le même schéma de quantification — supprimant tout écart entraînement/inférence.
  • Modèle brouillon (draft model) : la couche MTP pré-entraînée est affinée en modèle brouillon de style EAGLE-3, pour le décodage spéculatif.

Vérification de compréhension

Pourquoi ne pas simplement faire du RL directement sur le modèle pré-entraîné ?

Parce que le RL a besoin d'un point de départ qui produit déjà des trajectoires au bon format et parfois réussies. Si le modèle n'appelle jamais correctement un outil, toutes les trajectoires échouent, toutes les récompenses sont nulles, et il n'y a aucun signal d'apprentissage. Le SFT fournit ce « démarrage à froid » (cold start).

Quel est le risque principal d'un modèle unifié par MOPD ?

L'interférence entre domaines : ce qui améliore le code peut dégrader la conversation. Le rapport ne publie pas de mesure de cette dégradation par rapport aux neuf experts individuels — on ne sait donc pas quel est le « coût de l'unification ». Voir Questions ouvertes.


Chapitre précédent : Entraînement et lois d'échelle · Chapitre suivant : Inférence : cache KV, décodage, quantification