Recette de pré-entraînement¶
Le multimodal natif, dès le premier pas¶
Le choix structurant
Kimi K3 optimise conjointement langage et vision dès le début de l'entraînement, au lieu de greffer un encodeur visuel sur un modèle de langage pré-entraîné par une étape d'alignement a posteriori.
Jetons visuels et textuels sont entrelacés dans un unique objectif de prédiction du jeton suivant, ce qui permet au backbone partagé d'apprendre des représentations multimodales unifiées dès l'origine.
C'est la contrepartie logique de MoonViT-V2 entraîné depuis zéro : si l'encodeur n'est pas pré-entraîné séparément, il n'y a rien à aligner après coup.
| Approche | Description | Utilisée par |
|---|---|---|
| Greffe + alignement | LLM pré-entraîné, puis on attache un ViT et on aligne | La majorité des modèles multimodaux, dont Kimi K2.5 |
| Natif | Tout est entraîné ensemble depuis le début | Kimi K3 |
Les paramètres d'optimisation¶
Ce que le rapport publie explicitement :
| Élément | Valeur |
|---|---|
| Optimiseur | Per-Head Muon (détail) |
| Mécanisme de weight clipping | Celui introduit dans Kimi K2 |
| Équilibrage MoE | Quantile Balancing (détail) |
| Calendrier de LR | Cosinus |
| Warmup | Linéaire, 1 % du budget total |
| Weight decay | 0,1, constant |
| Contexte initial | 8 K jetons |
| Contexte en phase 2 | 64 K jetons |
Le warmup à 1 %
C'est court. Sur un entraînement de, disons, 400 000 pas, cela ferait 4 000 pas de montée. Un warmup court n'est viable que si l'architecture est bien conditionnée — ce qui est précisément l'objet de tous les mécanismes de stabilisation de K3 (SiTU-GLU, RMSNorm du LatentMoE, décroissance bornée, Per-Head Muon).
Ce que le rapport ne publie pas¶
| Élément | Statut |
|---|---|
| Taux d'apprentissage de pointe | ❌ |
| Taux d'apprentissage minimal | ❌ |
| Taille de lot | ❌ |
| Nombre total de pas | ❌ |
| Nombre total de jetons | ❌ |
| Ratio TPP | ❌ |
| Détails du weight clipping | ❌ (renvoi à K2) |
| Nombre d'itérations de Newton–Schulz | ❌ |
| Nombre de GPU, durée | ❌ |
| Coût énergétique / carbone | ❌ |
L'absence la plus notable
Aucun chiffre de budget de calcul. On ne sait ni combien de GPU ont été employés, ni pendant combien de temps, ni pour quel coût.
C'est une différence de culture par rapport aux rapports Chinchilla, PaLM ou même Llama, qui donnaient ces chiffres. En 2026, la norme dans l'industrie est de ne plus les publier.
Les deux phases de pré-entraînement¶
Phase 1 : contexte 8 K
└─► le gros du budget ; le modèle apprend le langage,
le code, les maths, la vision, à faible coût par jeton
Phase 2 : contexte 64 K
└─► adaptation à des dépendances plus longues
─── fin du pré-entraînement proprement dit ───
Cooldown : 256 K puis 1 M
└─► voir chapitre suivant
Pourquoi commencer si court ?
Le coût d'attention croît avec la longueur, et l'essentiel de ce qu'un modèle doit apprendre (grammaire, faits, syntaxe de code, structure visuelle) est accessible dans une fenêtre de 8 K. Concentrer le budget là où il est le moins cher est un choix d'efficacité pure.
L'articulation avec l'infrastructure¶
Cette recette n'est réalisable que grâce à cinq mécanismes d'infrastructure décrits ailleurs :
| Contrainte | Mécanisme | Page |
|---|---|---|
| 896 experts déséquilibrés | MoonEP, équilibrage parfait | 03 |
| Activations dépassant la mémoire | Gestionnaire unifié : recalcul, FP8, déchargement | 04 |
| Encodeur visuel sur le chemin critique | CP dynamique + calcul dans les bulles de pipeline | 05 |
| Séquences de 1 M | KDA Context Parallelism | 02 |
| Muon distribué | Orthogonalisation P2P | 04 |
La leçon
Chez Kimi K3, il n'y a pas de « recette d'entraînement » séparable de l'infrastructure. Le calendrier de contexte, le choix de l'optimiseur et la structure du MoE sont dictés autant par ce que le matériel permet que par ce que la théorie suggère.
Vérification de compréhension¶
Pourquoi un weight decay constant à 0,1 plutôt que décroissant ?
Le rapport ne le justifie pas. C'est une valeur usuelle et robuste. Un weight decay constant, combiné à un LR décroissant en cosinus, fait mécaniquement croître la régularisation relative en fin d'entraînement — ce qui est généralement souhaitable.
L'entraînement conjoint vision+langage ne risque-t-il pas de dégrader le texte ?
C'est le risque classique de l'entraînement multitâche. Le rapport ne publie pas de comparaison avec un K3 purement textuel, donc on ne peut pas répondre. On observe seulement que K3 reste compétitif sur les bancs purement textuels (GPQA Diamond : 93,5 %), ce qui suggère que la dégradation, si elle existe, est limitée.
Chapitre précédent : Lois d'échelle · Chapitre suivant : Extension du contexte à 1 M