Aller au contenu

Données de pré-entraînement

C'est la partie la plus courte du rapport — deux paragraphes — et l'une des plus importantes. Cette asymétrie mérite d'être notée : les données sont le secret industriel le mieux gardé de tous les laboratoires, Moonshot compris.

Le corpus texte

Quatre domaines primaires :

Domaine Contenu
Web Text Texte web général
Code Code source
Mathematics Mathématiques
Knowledge Connaissances (encyclopédique, scientifique, technique)

Chacun est filtré par une combinaison de trois techniques :

  1. Heuristiques à base de règles — élimination des documents trop courts, trop répétitifs, mal encodés, principalement composés de balises.
  2. Notation de qualité par classifieur — un modèle apprend à distinguer contenu de qualité et contenu médiocre, et note tout le corpus.
  3. Déduplication — exacte et floue.

Comment les proportions sont choisies

Le rapport indique que les taux d'échantillonnage par domaine sont déterminés par des études d'ablation sur de plus petits modèles.

C'est la méthode standard : on entraîne des modèles de quelques milliards de paramètres avec différentes recettes de mélange, on compare les pertes de validation, puis on extrapole. Les proportions retenues ne sont pas publiées.

La reformulation (rephrasing)

Technique héritée de Kimi K2 et reconduite pour K3, appliquée aux corpus de connaissance et de mathématiques.

Le principe : au lieu de présenter plusieurs fois le même document au modèle (ce qui provoque de la mémorisation sans généralisation), on le réécrit sous plusieurs formes.

Trois composants :

Composant Rôle
Prompting divers en style et perspective Réécrire le même contenu comme un cours, un dialogue, un résumé, une explication à un enfant…
Génération autorégressive par morceaux Réécrire par blocs, pour préserver la cohérence des longs documents
Vérification de fidélité Contrôler que la réécriture reste factuellement conforme à la source

Pourquoi c'est efficace

Un fait exprimé de dix manières différentes force le modèle à extraire le contenu plutôt qu'à mémoriser la formulation. C'est une forme d'augmentation de données appliquée au langage.

Le risque associé

La reformulation est produite par un modèle. Si celui-ci hallucine, l'erreur entre dans le corpus d'entraînement et sera apprise. D'où la vérification de fidélité contre le document source — dont le rapport ne détaille ni la méthode ni le taux de rejet.

Le corpus visuel

Il suit la taxonomie de Kimi K2.5, en combinant collections ouvertes et pipelines internes de filtrage, synthèse et déduplication.

Catégorie Contenu
Légendes Images avec description textuelle
Documents entrelacés Pages mêlant texte et images
OCR Reconnaissance de texte dans les images
Perception Détection, localisation, comptage
Vidéo Séquences temporelles
Code visuel Code source couplé à son rendu

Deux particularités méthodologiques

Coordonnées en double format

La supervision de coordonnées est fournie à la fois en absolu (pixels) et en normalisé (\([0,1]\)).

Effet revendiqué : localisation précise (l'absolu) et robuste à la résolution (le normalisé). Un modèle entraîné uniquement en absolu se dégrade quand la résolution d'entrée change ; entraîné uniquement en normalisé, il perd en précision fine.

Données multimodales programmatiques

« Substantiellement mises à l'échelle » selon le rapport : des extraits de code couplés à leur rendu visuel, dans des formats spécifiques — SVG, actifs 3D, pages web, jeux, schémas CAO.

C'est un choix de corpus qui explique directement des résultats d'évaluation : Kimi K3 est premier du WebDev Arena (1 678 Elo, premier modèle ouvert à occuper cette place) et écrase la concurrence sur les tâches 3D/WebGL dans les évaluations internes.

C'est probablement le levier de différenciation le plus net de tout le modèle — et il est purement lié aux données, pas à l'architecture.

Ce qui n'est pas publié

Information Statut
Nombre total de jetons ❌ Non publié
Proportions par domaine ❌ Non publiées
Sources précises ❌ Non publiées
Langues couvertes et proportions ❌ Non publiées
Politique vis-à-vis du contenu sous copyright ❌ Non abordée
Date de coupure des connaissances ❌ Non publiée
Seuils des classifieurs de qualité ❌ Non publiés
Taux de rejet de la vérification de fidélité ❌ Non publié

La conséquence pour la reproductibilité

C'est le point qui rend Kimi K3 irreproductible, bien plus que l'architecture. Chaque équation du rapport peut être réimplémentée ; le corpus, non.

Comme les données comptent au moins autant que l'architecture dans la qualité finale, il faut lire l'affirmation « 2,5× d'efficacité d'échelle » en gardant à l'esprit que le rapport attribue ce gain à l'architecture et aux recettes de données et d'entraînement conjointement, sans les séparer.

Vérification de compréhension

Pourquoi ne pas simplement entraîner sur plusieurs époques du même corpus ?

Parce que la répétition à l'identique provoque de la mémorisation sans gain de généralisation, et fait monter la perte de validation après quelques époques. La reformulation offre les bénéfices de la répétition (revoir un contenu) sans son défaut (revoir la même surface textuelle).

Pourquoi les données de code visuel sont-elles si efficaces ?

Parce qu'elles fournissent un signal d'apprentissage bidirectionnel et parfaitement aligné : le code est la cause, le rendu est l'effet, et le lien est exact — contrairement à une légende d'image, qui est une description approximative et subjective. Le modèle apprend une correspondance déterministe, ce qui est bien plus informatif.


Chapitre suivant : Lois d'échelle et hyperparamètres