Distillation multi-professeurs (MOPD)¶
Multi-Teacher On-Policy Distillation. L'étape qui transforme neuf modèles experts en un seul modèle livrable.
Le problème¶
À l'issue du RL, Moonshot dispose de neuf politiques :
low |
high |
max |
|
|---|---|---|---|
| Tâches générales | expert 1 | expert 2 | expert 3 |
| Agents généraux | expert 4 | expert 5 | expert 6 |
| Agents de code | expert 7 | expert 8 | expert 9 |
Chacune pèse 2,8 T de paramètres. Les livrer toutes serait absurde : 14 To de poids, neuf déploiements, et une logique de routage à la charge de l'utilisateur.
L'idée : la distillation on-policy¶
Distillation classique¶
Un modèle élève est entraîné à reproduire les sorties d'un modèle professeur, sur des données fixes générées par le professeur.
Le défaut
L'élève n'apprend que sur la distribution du professeur. En déploiement, il génère selon sa propre distribution — et se retrouve dans des états qu'il n'a jamais vus en entraînement. Les erreurs s'accumulent.
Distillation on-policy¶
L'élève génère lui-même les trajectoires ; le professeur les note. L'élève apprend donc à corriger ses propres erreurs, dans les états où il se place réellement.
La formule de Kimi K3¶
| Symbole | Signification |
|---|---|
| \(d\) | Le domaine (général / agent / code) |
| \(e\) | Le niveau d'effort échantillonné dans \(\{\)low, high, max\(\}\) |
| \(\pi_{\text{teacher}}^{(d,e)}\) | Le professeur correspondant, parmi les neuf |
| \(\pi_\theta\) | L'élève — le modèle unifié en cours d'entraînement |
| \(y_{<t}\) | Le préfixe de réponse déjà généré |
| \(\operatorname{sg}\) | Stop-gradient : la quantité est traitée comme une constante |
| \(\operatorname{clip}\) | Bornage à \(\pm R_{\max}\) |
Lecture, terme par terme¶
Le rapport de log-probabilités. \(\log \frac{\pi_{\text{teacher}}}{\pi_\theta}\) mesure le désaccord sur le jeton \(y_t\) :
| Cas | Valeur | Interprétation |
|---|---|---|
| Le professeur juge \(y_t\) plus probable que l'élève | \(> 0\) | Récompense : produis plus souvent ce genre de jeton |
| Accord parfait | \(= 0\) | Signal neutre |
| L'élève surestime \(y_t\) | \(< 0\) | Pénalité |
Le stop-gradient. La récompense est traitée comme une constante. Elle n'est pas dérivée : elle entre dans l'algorithme RL comme n'importe quelle récompense externe.
Le clip. Empêche les signaux d'avantage extrêmes — un jeton auquel l'élève donne une probabilité quasi nulle produirait un logarithme divergent.
Le point crucial : \(\pi_\theta(y_t \mid e, x, y_{<t})\)
Remarquez que l'élève reçoit \(e\) en entrée, alors que le professeur ne l'a pas : il est l'expert pour ce niveau.
C'est ce qui permet à un modèle unique d'apprendre les trois comportements. Selon le niveau d'effort présent dans son contexte, il apprend à imiter un professeur différent.
Pourquoi ce choix est élégant¶
Trois propriétés
1. La récompense est dense. Une valeur par jeton, et non une seule en fin de trajectoire. Le signal d'apprentissage est bien plus riche qu'un RL classique à récompense terminale.
2. Elle s'intègre sans modification. Le rapport : this dense reward signal seamlessly integrates into our RL framework. Toute l'infrastructure existante — dont le partial rollout pour les tâches long-horizon — fonctionne telle quelle.
3. Elle est on-policy. L'élève apprend sur ses propres trajectoires, donc dans les états qu'il visitera réellement.
Ce qui a été essayé et écarté¶
Bien que nous ayons aussi expérimenté des objectifs de distillation top-\(k\) plus fins, nous n'avons observé aucun avantage clair ni sur la vitesse de convergence ni sur la performance finale dans notre configuration.
Ce que cela signifie
Une distillation top-\(k\) aligne l'élève sur les \(k\) jetons les plus probables du professeur, pas seulement sur celui échantillonné. C'est plus informatif en théorie, et plus coûteux en pratique (il faut transmettre \(k\) logits par position).
Ce résultat négatif est utile : il indique qu'un simple rapport de vraisemblance sur le jeton observé suffit à cette échelle.
Ce que le rapport ne mesure pas¶
La question ouverte la plus importante de cette section
Quel est le coût de l'unification ?
Aucune comparaison n'est publiée entre le modèle unifié et les neuf experts individuels. On ne sait donc pas :
- si le modèle unifié perd des points par rapport à l'expert du domaine ;
- s'il y a interférence entre domaines (le code dégradant la conversation) ;
- si les trois niveaux d'effort sont fidèlement reproduits.
Ces questions sont d'autant plus légitimes que le RL avait précisément spécialisé ces neuf modèles. Voir Questions ouvertes.
Le contexte de la méthode¶
MOPD n'est pas propre à Moonshot. Le rapport cite trois travaux : la distillation on-policy de Thinking Machines, MiMo-v2-Flash et DeepSeek-V4.
Une convergence de l'industrie en 2026
Le schéma « spécialiser par RL, puis refusionner par distillation » est devenu un standard. Il permet de contourner une difficulté réelle : le RL multi-domaines simultané est instable, car les récompenses de domaines différents ne sont pas commensurables. Spécialiser d'abord, fusionner ensuite, contourne le problème.
Vérification de compréhension¶
Pourquoi ne pas simplement faire du RL sur tous les domaines à la fois ?
Parce que les récompenses ne sont pas comparables entre domaines : une réussite sur un noyau GPU (score de performance continu) et une préférence de juge sur une réponse conversationnelle (comparaison binaire) n'ont ni la même échelle ni la même variance. Les mélanger produit un signal dominé par le domaine le plus bruité ou le plus récompensé, et une instabilité connue.
Le modèle final est-il « meilleur » que ses professeurs ?
Presque certainement non sur chaque domaine pris isolément — un élève distillé égale rarement son professeur sur le terrain de ce dernier. Mais il est meilleur que chacun sur l'ensemble des domaines, et surtout il est déployable. Le rapport ne quantifie pas cet arbitrage.
Que se passe-t-il si l'élève génère une trajectoire que le professeur n'aurait jamais produite ?
C'est précisément le cas d'usage de la distillation on-policy : le professeur évalue quand même chaque jeton, et le rapport de log-probabilités indique à l'élève ce qu'il aurait dû produire à cet endroit. C'est ce qui corrige l'accumulation d'erreurs, contrairement à la distillation hors-politique.
Chapitre précédent : L'effort de raisonnement · Chapitre suivant : Environnements RL