Aller au contenu

Recette de pré-entraînement

Le multimodal natif, dès le premier pas

Le choix structurant

Kimi K3 optimise conjointement langage et vision dès le début de l'entraînement, au lieu de greffer un encodeur visuel sur un modèle de langage pré-entraîné par une étape d'alignement a posteriori.

Jetons visuels et textuels sont entrelacés dans un unique objectif de prédiction du jeton suivant, ce qui permet au backbone partagé d'apprendre des représentations multimodales unifiées dès l'origine.

C'est la contrepartie logique de MoonViT-V2 entraîné depuis zéro : si l'encodeur n'est pas pré-entraîné séparément, il n'y a rien à aligner après coup.

Approche Description Utilisée par
Greffe + alignement LLM pré-entraîné, puis on attache un ViT et on aligne La majorité des modèles multimodaux, dont Kimi K2.5
Natif Tout est entraîné ensemble depuis le début Kimi K3

Les paramètres d'optimisation

Ce que le rapport publie explicitement :

Élément Valeur
Optimiseur Per-Head Muon (détail)
Mécanisme de weight clipping Celui introduit dans Kimi K2
Équilibrage MoE Quantile Balancing (détail)
Calendrier de LR Cosinus
Warmup Linéaire, 1 % du budget total
Weight decay 0,1, constant
Contexte initial 8 K jetons
Contexte en phase 2 64 K jetons

Le warmup à 1 %

C'est court. Sur un entraînement de, disons, 400 000 pas, cela ferait 4 000 pas de montée. Un warmup court n'est viable que si l'architecture est bien conditionnée — ce qui est précisément l'objet de tous les mécanismes de stabilisation de K3 (SiTU-GLU, RMSNorm du LatentMoE, décroissance bornée, Per-Head Muon).

Ce que le rapport ne publie pas

Élément Statut
Taux d'apprentissage de pointe ❌
Taux d'apprentissage minimal ❌
Taille de lot ❌
Nombre total de pas ❌
Nombre total de jetons ❌
Ratio TPP ❌
Détails du weight clipping ❌ (renvoi à K2)
Nombre d'itérations de Newton–Schulz ❌
Nombre de GPU, durée ❌
Coût énergétique / carbone ❌

L'absence la plus notable

Aucun chiffre de budget de calcul. On ne sait ni combien de GPU ont été employés, ni pendant combien de temps, ni pour quel coût.

C'est une différence de culture par rapport aux rapports Chinchilla, PaLM ou même Llama, qui donnaient ces chiffres. En 2026, la norme dans l'industrie est de ne plus les publier.

Les deux phases de pré-entraînement

Phase 1 :  contexte 8 K
           └─► le gros du budget ; le modèle apprend le langage,
               le code, les maths, la vision, à faible coût par jeton

Phase 2 :  contexte 64 K
           └─► adaptation à des dépendances plus longues

           ─── fin du pré-entraînement proprement dit ───

Cooldown : 256 K puis 1 M
           └─► voir chapitre suivant

Pourquoi commencer si court ?

Le coût d'attention croît avec la longueur, et l'essentiel de ce qu'un modèle doit apprendre (grammaire, faits, syntaxe de code, structure visuelle) est accessible dans une fenêtre de 8 K. Concentrer le budget là où il est le moins cher est un choix d'efficacité pure.

L'articulation avec l'infrastructure

Cette recette n'est réalisable que grâce à cinq mécanismes d'infrastructure décrits ailleurs :

Contrainte Mécanisme Page
896 experts déséquilibrés MoonEP, équilibrage parfait 03
Activations dépassant la mémoire Gestionnaire unifié : recalcul, FP8, déchargement 04
Encodeur visuel sur le chemin critique CP dynamique + calcul dans les bulles de pipeline 05
Séquences de 1 M KDA Context Parallelism 02
Muon distribué Orthogonalisation P2P 04

La leçon

Chez Kimi K3, il n'y a pas de « recette d'entraînement » séparable de l'infrastructure. Le calendrier de contexte, le choix de l'optimiseur et la structure du MoE sont dictés autant par ce que le matériel permet que par ce que la théorie suggère.

Vérification de compréhension

Pourquoi un weight decay constant à 0,1 plutôt que décroissant ?

Le rapport ne le justifie pas. C'est une valeur usuelle et robuste. Un weight decay constant, combiné à un LR décroissant en cosinus, fait mécaniquement croître la régularisation relative en fin d'entraînement — ce qui est généralement souhaitable.

L'entraînement conjoint vision+langage ne risque-t-il pas de dégrader le texte ?

C'est le risque classique de l'entraînement multitâche. Le rapport ne publie pas de comparaison avec un K3 purement textuel, donc on ne peut pas répondre. On observe seulement que K3 reste compétitif sur les bancs purement textuels (GPQA Diamond : 93,5 %), ce qui suggère que la dégradation, si elle existe, est limitée.


Chapitre précédent : Lois d'échelle · Chapitre suivant : Extension du contexte à 1 M