Aller au contenu

Apprentissage par renforcement

La stratégie : trois domaines larges, pas des tâches individuelles

Le choix structurant

Plutôt que d'entraîner des modèles RL spécialisés pour des tâches individuelles, Kimi K3 met à l'échelle le RL sur trois domaines larges, chacun englobant un vaste spectre de sous-tâches, et entraîne un expert par domaine pour chaque niveau d'effort.

Domaine Sous-tâches couvertes
Tâches générales Expérience générale, vision, raisonnement, fidélité, capacités de recherche, travail de connaissance
Agents généraux Tâches d'assistant long-horizon, recherche approfondie, écriture au niveau du paragraphe
Agents de code Ingénierie logicielle (SWE), expérience de codage, tâches de noyaux GPU, développement web

Croisés avec trois niveaux d'effort \(\{\)low, high, max\(\}\), cela donne neuf modèles experts.

Pourquoi des domaines larges plutôt que des tâches

Pour obtenir de la généralisation compositionnelle : un modèle entraîné sur une tâche unique apprend cette tâche ; un modèle entraîné sur un domaine large apprend la boucle commune à ce domaine — raisonner, agir, observer, vérifier, s'adapter.

Ce que le RL apporte, mesuré

La figure 6 du rapport montre, pendant le RL :

  • les scores sur une variété d'évaluations publiques et internes ;
  • le nombre moyen d'étapes assistant par trajectoire.

Le résultat

By scaling RL FLOPs, tool-call steps scale up consistently, accompanied by a comprehensive improvement in the model's overall capability.

Autrement dit : plus on investit de calcul dans le RL, plus le modèle utilise d'étapes d'outils, et plus il est capable. Les deux montent ensemble.

C'est une observation importante : la capacité long-horizon n'est pas un effet secondaire du contexte de 1 M, c'est un comportement appris par le RL.

Le rapport indique que ces améliorations couvrent connaissance, raisonnement, vision, agent général et codage.

Le partial rollout

Le problème

En RL agentique long-horizon, produire une trajectoire complète peut demander des heures : des milliers d'appels d'outils, des millions de jetons. Attendre la fin de toutes les trajectoires avant de mettre à jour la politique signifierait que le débit est dicté par la plus lente — les stragglers.

Le mécanisme

Kimi K3 étend le schéma de partial rollout de son cadre RL synchrone (introduit dans k1.5, repris dans K2.5).

Itération n :
   • échantillonner K complétions pour chacun de N prompts
     → charge active de N × K trajectoires
   • dès qu'une fraction λ ∈ (0,1) des trajectoires est terminée
     (soit λNK), METTRE EN PAUSE la génération
   • les trajectoires en pause sont mises en file, PRIORISÉES
     pour reprise au début de l'itération n+1
   • dès que les K réponses d'un prompt sont complètes, elles partent
     immédiatement en optimisation de politique

La reprise est rendue possible par l'infrastructure de sandboxes, qui sait mettre en pause et reprendre un environnement complet.

Le prix : l'obsolescence des données

Le problème créé

Une trajectoire longue s'étend naturellement sur plusieurs itérations. Quand elle se termine, elle a été partiellement produite par des politiques périmées. C'est un régime fortement hors-politique (off-policy), qui menace la stabilité de l'entraînement.

La réponse

Notre algorithme d'optimisation de politique tolère intrinsèquement un tel régime extrême hors-politique grâce à une régularisation par jeton. En contraignant les mises à jour de politique à un voisinage local, cette régularisation permet à l'algorithme de gérer robustement des données très périmées et soutient la stabilité de l'entraînement.

Lacune majeure de reproductibilité

La formule de cette régularisation n'est pas donnée. Le rapport dit seulement que l'optimisation « suit l'algorithme de Kimi K2.5 » et décrit l'effet en prose.

C'est, avec les données, l'omission la plus lourde du rapport : le mécanisme qui rend possible tout le RL long-horizon n'est pas publié. Voir Ce qui est public.

Le modèle de récompense génératif agentique (GRM)

Pour les tâches générales non vérifiables (une réponse conversationnelle, un rapport, un texte), on ne peut pas calculer une récompense.

Kimi K3 emploie un GRM agentique, conservant la récompense de groupe en tournoi avec comparaisons binaires de K2.5.

Le protocole obligatoire du juge

Au-delà de ses capacités agentiques génériques, le juge doit suivre une procédure imposée :

Étape Action
1 Lire le résultat, le produit ou la sortie textuelle
2 Générer une grille de critères (rubric)
3 Noter chaque candidat contre cette grille
4 Consigner les scores attribués dans un scorepad

Pourquoi imposer ce protocole

Un juge libre a tendance à produire une préférence globale non explicitée, donc instable et sensible aux artefacts de surface (longueur, mise en forme, ton assuré).

Forcer la production d'une grille avant la notation rend le jugement explicite, décomposé et auditable. C'est aussi ce qui permet de détecter les dérives.

Le contrôle de verbosité

Le reward hacking le plus classique

Un modèle jugé par un autre modèle apprend très vite que les réponses plus longues gagnent plus souvent. La dérive vers la verbosité est le mode de défaillance le plus prévisible du RLHF.

La parade de Kimi K3 est directement analogue au contrôle d'effort : étant donné une verbosité initiale \(\ell_0\) estimée sur le modèle de démarrage à froid et un multiplicateur \(\sigma\), un candidat dont la sortie dépasse \(\sigma \cdot \ell_0\) perd automatiquement la comparaison binaire.

C'est brutal, mais efficace : la sanction est structurelle, pas un terme de pénalité que le modèle pourrait apprendre à contourner.

L'infrastructure requise

Le RL de Kimi K3 est colocalisé (co-located) : entraînement et déploiement partagent les mêmes GPU. Le rapport indique que cela garde chaque expérience RL à contexte de 1 M dans quelques centaines de GPU.

Les mécanismes associés sont décrits en Infra pour le RL 1 M :

Mécanisme Rôle
Pool de cache KV externe (DRAM CPU) Conserver les préfixes entre itérations
Ordonnanceur à auto-throttling Ajuster la concurrence selon la pression sur le cache
Réutilisation des tampons de gradient Loger les modèles de référence sans mémoire supplémentaire
Déchargement des états d'entraînement sur NVMe Libérer de la DRAM pour le pool

Vérification de compréhension

Pourquoi \(K\) complétions par prompt plutôt qu'une seule ?

Parce que l'estimation de l'avantage a besoin d'une base de comparaison. Avec \(K\) réponses au même prompt, on peut normaliser les récompenses au sein du groupe : une réponse est bonne relativement aux autres réponses au même problème, ce qui élimine la difficulté intrinsèque du prompt comme facteur de confusion. C'est le principe des méthodes de type GRPO.

Que se passe-t-il si λ est trop petit ?

On met à jour la politique sur très peu de trajectoires complètes, donc avec un signal bruité, et une proportion énorme de trajectoires reste en attente, devenant de plus en plus périmée. Si λ est trop grand, on retombe sur le problème des stragglers. Le rapport ne donne pas la valeur de λ retenue.

Le GRM introduit-il un biais vers le style du juge ?

Certainement — c'est un risque inhérent. Le juge étant lui-même un modèle Kimi, on peut s'attendre à une convergence stylistique. Le protocole de grille l'atténue en rendant les critères explicites, mais ne l'élimine pas. Le rapport ne mesure pas ce biais.


Chapitre précédent : SFT et XTML · Chapitre suivant : L'effort de raisonnement