Vision native : MoonViT-V2¶
Prérequis
Le chapitre Vision et multimodalité des Fondations, qui explique ce qu'est un Vision Transformer.
Ce que « nativement multimodal » signifie¶
Pas d'étape d'alignement de modalité a posteriori. Les jetons visuels et textuels sont entrelacés dès le début du pré-entraînement, sous un unique objectif de prédiction du jeton suivant.
Pourquoi c'est le fondement de tout le reste
Le rapport le formule directement : les sorties rendues et le code qui les a produites vivent dans le même flux de jetons. Le modèle peut écrire du code, inspecter une capture d'écran ou des images de vidéo du résultat, et raffiner itérativement l'artefact visuel — interfaces, graphismes, vidéo — sans passer la main à un autre modèle.
C'est l'assise architecturale du comportement « vision dans la boucle » décrit dans les environnements RL.
L'architecture¶
| Caractéristique | Valeur |
|---|---|
| Couches | 27 |
| Paramètres | ~401 M |
| Dimension cachée | 1 024 |
| Dimension intermédiaire | 4 096 |
| Têtes d'attention | 12 |
| Taille de carreau | 14 × 14 pixels |
| Normalisation | RMSNorm |
| Biais linéaires et d'attention | Aucun |
| Activation | GELU (approximation tanh) |
| Projecteur | MLP léger, type patchmergerv2 |
| Fusion avant projection | pixel-shuffle 2 × 2 |
| Résolution maximale | 3 584 × 3 584 pixels |
Le rapport indique que l'absence de biais et l'usage de RMSNorm sont des choix qui stabilisent davantage l'optimisation depuis zéro — cohérents avec la décision centrale décrite ci-dessous.
Le traitement des vidéos¶
Paramètres entièrement partagés avec les images, comme dans MoonViT-3D :
- l'attention est factorisée en une passe spatiale intra-image et une passe temporelle inter-images ;
- un regroupement temporel compresse encore les jetons le long de l'axe du temps.
Le budget de jetons¶
Le calcul qui rend la chose viable
Une image pleine résolution consomme ~16 000 jetons, soit 1,6 % du contexte de 1 M. C'est ce qui permet des dizaines de captures d'écran dans une même trajectoire agentique.
L'innovation : entraîner depuis zéro¶
C'est le point où Kimi K3 rompt avec la pratique dominante, y compris avec sa propre génération précédente.
La pratique et son fondement¶
Presque tous les modèles multimodaux — dont Kimi K2.5 — initialisent leur encodeur visuel depuis un modèle pré-entraîné par apprentissage contrastif (SigLIP, CLIP). Prémisse : les connaissances visuelles pré-acquises donnent une avance.
Le choix de K3¶
A key departure from Kimi K2.5 is that we train Kimi K3 vision encoder, MoonViT-V2, entirely from scratch with next-token prediction.
Justification 1 : la stabilité — la raison principale¶
Le constat
Quand un encodeur pré-entraîné est attaché au LLM, l'optimisation conjointe devient instable.
Mesure directe publiée (figure 5 du rapport) : le MoonViT-3D initialisé depuis SigLIP présente des normes de gradient durablement plus élevées, avec des pics fréquents, tandis que MoonViT-V2 reste stable tout au long de l'entraînement.
C'est une observation empirique, pas une démonstration. L'explication implicite : deux sous-réseaux façonnés par des objectifs différents, brutalement couplés, ne sont pas dans le même régime d'optimisation, et le désaccord se manifeste d'abord dans les gradients.
Justification 2 : la nature des représentations¶
Une perte contrastive favorise la sémantique globale — « il y a un chien sur cette image ». Elle sous-pondère les indices textuels et structurels fins : le contenu exact d'un tableau, l'alignement d'une interface, un caractère dans une capture d'écran.
Un objectif de prédiction du jeton suivant laisse l'objectif de modélisation du langage façonner directement les représentations visuelles.
Pourquoi c'est cohérent avec les cas d'usage visés
Kimi K3 vise le travail de connaissance et le développement web : lire des PDF rendus en images, comparer un rendu à une maquette, repérer un décalage de quelques pixels. Ce sont exactement les tâches où la sémantique globale ne suffit pas.
Le résultat¶
MoonViT-V2 matches the SigLIP-initialized baseline across vision evaluations, indicating that contrastive pre-training is unnecessary as an initialization for multimodal language models at scale.
Trois nuances importantes
- « Égale », pas « dépasse ». Le gain revendiqué est la stabilité et la simplification du pipeline, pas la performance brute.
- « À l'échelle » (at scale). L'affirmation ne porte pas sur les petits modèles, où l'initialisation compte davantage.
- Aucun chiffre d'ablation n'est publié pour cette comparaison. Seule la courbe de normes de gradient l'est. C'est une affirmation étayée par une figure et une assertion, pas par un tableau.
Les données visuelles¶
Le corpus suit la taxonomie de Kimi K2.5 : légendes, documents image–texte entrelacés, OCR, perception, vidéo, code visuel. Il combine collections ouvertes et pipelines internes de filtrage, synthèse et déduplication.
Deux particularités notables :
Supervision de coordonnées en double format
Les coordonnées sont fournies à la fois en absolu (pixels) et en normalisé (\([0,1]\)). Le rapport : cela permet une localisation à la fois précise et robuste à la résolution.
C'est un détail d'ingénierie de données qui compte pour les tâches d'usage d'ordinateur (OSWorld) et de manipulation d'interfaces.
Données multimodales programmatiques
Fortement mises à l'échelle : des extraits de code couplés à leur rendu visuel, dans des formats spécifiques — SVG, actifs 3D, pages web, jeux, schémas CAO.
C'est très probablement l'explication du résultat le plus net de K3 sur les évaluations internes : sur le Kimi Webdev Bench, les juges experts préfèrent K3 à Claude Opus 4.8 avec +59,1 points d'écart sur les tâches 3D / WebGL / Shader — précisément le domaine où le lien code↔rendu est déterminant.
L'infrastructure associée¶
Deux optimisations, détaillées en Encodeur multimodal :
- Parallélisme de contexte dynamique : une grande image est partitionnée le long de la dimension des carreaux entre plusieurs GPU, l'attention étant calculée par rassemblement des paires clé–valeur. Les groupes CP sont subdivisés en sous-groupes pour répartir plusieurs grandes images de façon équilibrée, empêchant la fraction de communication de croître avec l'échelle.
- Calcul de l'encodeur dans les bulles de pipeline : sous l'ordonnancement 1F1B entrelacé, la plupart du calcul ViT est caché dans les bulles, éliminant l'essentiel de son surcoût effectif.
Vérification de compréhension¶
Pourquoi l'encodeur visuel n'est-il pas quantifié en MXFP4 ?
Le champ ignore de la configuration exclut explicitement vision_tower et
mm_projector. Raison probable : 401 M de paramètres représentent 0,014 %
du modèle — la quantification n'apporterait quasiment aucune économie
mémoire, pour un risque de dégradation sur les tâches de perception fine.
Le compromis est trivialement défavorable.
Que se passe-t-il si on envoie une image de 100 × 100 pixels ?
\((100/14)^2 \approx 51\) carreaux, arrondis selon le remplissage, puis fusion 2×2 → une douzaine de jetons visuels. Le coût est négligeable. La résolution native est donc préservée sans redimensionnement forcé, contrairement aux ViT à résolution fixe.
Le partage complet des paramètres entre images et vidéos est-il courant ?
Non, beaucoup de modèles utilisent des encodeurs ou des adaptateurs distincts. Le partage total, avec attention factorisée spatiale/temporelle, force une représentation unifiée et divise par deux le budget de paramètres visuels. C'est un héritage direct de MoonViT-3D (Kimi K2.5).
Chapitre précédent : Quantile Balancing · Chapitre suivant : Per-Head Muon