Entraînement de Kimi K3¶
Cette partie couvre tout ce qui transforme une architecture vide en modèle utilisable : les données, le pré-entraînement, l'extension du contexte, puis le post-entraînement complet.
La chaîne complète¶
DONNÉES PRÉ-ENTRAÎNEMENT POST-ENTRAÎNEMENT
──────── ───────────────── ──────────────────
Web contexte 8 K
Code ────► puis 64 K ────► SFT (+ QAT MXFP4)
Maths │ │
Connaissance ▼ ▼
Vision cooldown RL × 9 experts
256 K → 1 M (3 domaines × 3 efforts)
│
▼
MOPD
(fusion en 1 modèle)
│
▼
modèle brouillon EAGLE-3
Ordre de lecture¶
| # | Chapitre | Sujet |
|---|---|---|
| 01 | Données de pré-entraînement | Corpus texte et vision, filtrage, reformulation |
| 02 | Lois d'échelle et hyperparamètres | Le « 2,5× », cosinus contre WSD |
| 03 | Recette de pré-entraînement | Optimiseur, calendrier, stratégie multimodale |
| 04 | Extension du contexte à 1 M | Le curriculum en quatre phases, les données longues synthétiques |
| 05 | SFT et modèle de conversation XTML | Démarrage à froid, format de messages, canaux |
| 06 | Apprentissage par renforcement | Domaines, partial rollout, modèle de récompense |
| 07 | L'effort de raisonnement | Comment on entraîne low, high, max |
| 08 | Distillation multi-professeurs | MOPD, la fusion des 9 experts |
| 09 | Environnements RL | Boîte blanche, graphe de connaissances, AET, noyaux, assistant |
| 10 | Quantification et modèle brouillon | QAT MXFP4, EAGLE-3, perte LK |
L'idée directrice¶
Ce qui distingue le post-entraînement de K3
Il n'est pas conçu pour produire un bon répondeur, mais un bon exécutant long-horizon.
Le rapport le formule ainsi : les environnements entraînent une boucle générale de raisonner, agir, observer, vérifier et s'adapter — « souvent sur des centaines ou des milliers d'appels d'outils et des millions de jetons de contexte accumulés ».
Tout le reste (partial rollout, sandboxes reprenables, cache KV externe) existe pour rendre cette boucle entraînable à cette échelle.
Ce que le rapport ne dit pas¶
Lacunes majeures de reproductibilité
- Le nombre de jetons d'entraînement n'est jamais donné.
- Le budget de calcul (FLOPs, GPU-heures) n'est jamais donné.
- Les proportions de mélange entre domaines ne sont pas données.
- L'algorithme d'optimisation de politique RL n'est pas formulé ; le rapport renvoie à Kimi K2.5.
- Les hyperparamètres issus des lois d'échelle (LR de pointe, taille de lot, TPP) ne sont pas publiés.
Partie précédente : Architecture · Partie suivante : Infrastructure