Aller au contenu

Entraînement de Kimi K3

Cette partie couvre tout ce qui transforme une architecture vide en modèle utilisable : les données, le pré-entraînement, l'extension du contexte, puis le post-entraînement complet.

Prérequis

Chapitres 08 et 09 des Fondations.

La chaîne complète

  DONNÉES              PRÉ-ENTRAÎNEMENT           POST-ENTRAÎNEMENT
  ────────             ─────────────────          ──────────────────
  Web                   contexte 8 K
  Code        ────►     puis 64 K          ────►   SFT (+ QAT MXFP4)
  Maths                    │                          │
  Connaissance             ▼                          ▼
  Vision                cooldown                   RL × 9 experts
                        256 K → 1 M              (3 domaines × 3 efforts)
                                                     │
                                                     ▼
                                                    MOPD
                                              (fusion en 1 modèle)
                                                     │
                                                     ▼
                                              modèle brouillon EAGLE-3

Ordre de lecture

# Chapitre Sujet
01 Données de pré-entraînement Corpus texte et vision, filtrage, reformulation
02 Lois d'échelle et hyperparamètres Le « 2,5× », cosinus contre WSD
03 Recette de pré-entraînement Optimiseur, calendrier, stratégie multimodale
04 Extension du contexte à 1 M Le curriculum en quatre phases, les données longues synthétiques
05 SFT et modèle de conversation XTML Démarrage à froid, format de messages, canaux
06 Apprentissage par renforcement Domaines, partial rollout, modèle de récompense
07 L'effort de raisonnement Comment on entraîne low, high, max
08 Distillation multi-professeurs MOPD, la fusion des 9 experts
09 Environnements RL Boîte blanche, graphe de connaissances, AET, noyaux, assistant
10 Quantification et modèle brouillon QAT MXFP4, EAGLE-3, perte LK

L'idée directrice

Ce qui distingue le post-entraînement de K3

Il n'est pas conçu pour produire un bon répondeur, mais un bon exécutant long-horizon.

Le rapport le formule ainsi : les environnements entraînent une boucle générale de raisonner, agir, observer, vérifier et s'adapter — « souvent sur des centaines ou des milliers d'appels d'outils et des millions de jetons de contexte accumulés ».

Tout le reste (partial rollout, sandboxes reprenables, cache KV externe) existe pour rendre cette boucle entraînable à cette échelle.

Ce que le rapport ne dit pas

Lacunes majeures de reproductibilité

  • Le nombre de jetons d'entraînement n'est jamais donné.
  • Le budget de calcul (FLOPs, GPU-heures) n'est jamais donné.
  • Les proportions de mélange entre domaines ne sont pas données.
  • L'algorithme d'optimisation de politique RL n'est pas formulé ; le rapport renvoie à Kimi K2.5.
  • Les hyperparamètres issus des lois d'échelle (LR de pointe, taille de lot, TPP) ne sont pas publiés.

Voir Ce qui est public et ce qui ne l'est pas.


Partie précédente : Architecture · Partie suivante : Infrastructure