Données de pré-entraînement¶
C'est la partie la plus courte du rapport — deux paragraphes — et l'une des plus importantes. Cette asymétrie mérite d'être notée : les données sont le secret industriel le mieux gardé de tous les laboratoires, Moonshot compris.
Le corpus texte¶
Quatre domaines primaires :
| Domaine | Contenu |
|---|---|
| Web Text | Texte web général |
| Code | Code source |
| Mathematics | Mathématiques |
| Knowledge | Connaissances (encyclopédique, scientifique, technique) |
Chacun est filtré par une combinaison de trois techniques :
- Heuristiques à base de règles — élimination des documents trop courts, trop répétitifs, mal encodés, principalement composés de balises.
- Notation de qualité par classifieur — un modèle apprend à distinguer contenu de qualité et contenu médiocre, et note tout le corpus.
- Déduplication — exacte et floue.
Comment les proportions sont choisies
Le rapport indique que les taux d'échantillonnage par domaine sont déterminés par des études d'ablation sur de plus petits modèles.
C'est la méthode standard : on entraîne des modèles de quelques milliards de paramètres avec différentes recettes de mélange, on compare les pertes de validation, puis on extrapole. Les proportions retenues ne sont pas publiées.
La reformulation (rephrasing)¶
Technique héritée de Kimi K2 et reconduite pour K3, appliquée aux corpus de connaissance et de mathématiques.
Le principe : au lieu de présenter plusieurs fois le même document au modèle (ce qui provoque de la mémorisation sans généralisation), on le réécrit sous plusieurs formes.
Trois composants :
| Composant | Rôle |
|---|---|
| Prompting divers en style et perspective | Réécrire le même contenu comme un cours, un dialogue, un résumé, une explication à un enfant… |
| Génération autorégressive par morceaux | Réécrire par blocs, pour préserver la cohérence des longs documents |
| Vérification de fidélité | Contrôler que la réécriture reste factuellement conforme à la source |
Pourquoi c'est efficace
Un fait exprimé de dix manières différentes force le modèle à extraire le contenu plutôt qu'à mémoriser la formulation. C'est une forme d'augmentation de données appliquée au langage.
Le risque associé
La reformulation est produite par un modèle. Si celui-ci hallucine, l'erreur entre dans le corpus d'entraînement et sera apprise. D'où la vérification de fidélité contre le document source — dont le rapport ne détaille ni la méthode ni le taux de rejet.
Le corpus visuel¶
Il suit la taxonomie de Kimi K2.5, en combinant collections ouvertes et pipelines internes de filtrage, synthèse et déduplication.
| Catégorie | Contenu |
|---|---|
| Légendes | Images avec description textuelle |
| Documents entrelacés | Pages mêlant texte et images |
| OCR | Reconnaissance de texte dans les images |
| Perception | Détection, localisation, comptage |
| Vidéo | Séquences temporelles |
| Code visuel | Code source couplé à son rendu |
Deux particularités méthodologiques¶
Coordonnées en double format
La supervision de coordonnées est fournie à la fois en absolu (pixels) et en normalisé (\([0,1]\)).
Effet revendiqué : localisation précise (l'absolu) et robuste à la résolution (le normalisé). Un modèle entraîné uniquement en absolu se dégrade quand la résolution d'entrée change ; entraîné uniquement en normalisé, il perd en précision fine.
Données multimodales programmatiques
« Substantiellement mises à l'échelle » selon le rapport : des extraits de code couplés à leur rendu visuel, dans des formats spécifiques — SVG, actifs 3D, pages web, jeux, schémas CAO.
C'est un choix de corpus qui explique directement des résultats d'évaluation : Kimi K3 est premier du WebDev Arena (1 678 Elo, premier modèle ouvert à occuper cette place) et écrase la concurrence sur les tâches 3D/WebGL dans les évaluations internes.
C'est probablement le levier de différenciation le plus net de tout le modèle — et il est purement lié aux données, pas à l'architecture.
Ce qui n'est pas publié¶
| Information | Statut |
|---|---|
| Nombre total de jetons | ❌ Non publié |
| Proportions par domaine | ❌ Non publiées |
| Sources précises | ❌ Non publiées |
| Langues couvertes et proportions | ❌ Non publiées |
| Politique vis-à-vis du contenu sous copyright | ❌ Non abordée |
| Date de coupure des connaissances | ❌ Non publiée |
| Seuils des classifieurs de qualité | ❌ Non publiés |
| Taux de rejet de la vérification de fidélité | ❌ Non publié |
La conséquence pour la reproductibilité
C'est le point qui rend Kimi K3 irreproductible, bien plus que l'architecture. Chaque équation du rapport peut être réimplémentée ; le corpus, non.
Comme les données comptent au moins autant que l'architecture dans la qualité finale, il faut lire l'affirmation « 2,5× d'efficacité d'échelle » en gardant à l'esprit que le rapport attribue ce gain à l'architecture et aux recettes de données et d'entraînement conjointement, sans les séparer.
Vérification de compréhension¶
Pourquoi ne pas simplement entraîner sur plusieurs époques du même corpus ?
Parce que la répétition à l'identique provoque de la mémorisation sans gain de généralisation, et fait monter la perte de validation après quelques époques. La reformulation offre les bénéfices de la répétition (revoir un contenu) sans son défaut (revoir la même surface textuelle).
Pourquoi les données de code visuel sont-elles si efficaces ?
Parce qu'elles fournissent un signal d'apprentissage bidirectionnel et parfaitement aligné : le code est la cause, le rendu est l'effet, et le lien est exact — contrairement à une légende d'image, qui est une description approximative et subjective. Le modèle apprend une correspondance déterministe, ce qui est bien plus informatif.
Chapitre suivant : Lois d'échelle et hyperparamètres