Architecture de Kimi K3¶
C'est le cœur du wiki. Cette partie décrit ce que le modèle calcule, module par module, avec les formules du rapport et leur explication complète.
Le principe organisateur¶
Le rapport formule l'architecture autour d'une idée unique : faire circuler l'information selon trois dimensions.
| Dimension | Mécanisme | Chapitre |
|---|---|---|
| Longueur de séquence | Attention hybride : 3 KDA + 1 Gated MLA par bloc | 02, 03, 04 |
| Profondeur du réseau | Attention Residuals : chaque couche puise dans toutes les précédentes | 05 |
| Largeur du modèle | Stable LatentMoE : 16 experts actifs sur 896 | 06, 07, 08 |
Auxquelles s'ajoutent la voie visuelle native (09) et l'optimiseur (10), qui n'est pas une couche mais fait partie de l'architecture au sens où le rapport l'entend.
La phrase à retenir
Kimi K2 était un Transformer MoE classique, en plus grand. Kimi K3 change les trois axes à la fois : le mélange de jetons n'est plus l'attention softmax, le résidu n'est plus une addition, et le MoE n'opère plus à la largeur du modèle.
Ordre de lecture¶
| # | Chapitre | Ce qu'il apporte |
|---|---|---|
| 01 | Vue d'ensemble | Le schéma complet, couche par couche |
| 02 | L'attention hybride 3:1 | Pourquoi mélanger deux types d'attention |
| 03 | Kimi Delta Attention | Le module central, formules complètes |
| 04 | Gated MLA et NoPE | L'attention globale, et l'absence d'encodage positionnel |
| 05 | Attention Residuals | L'attention appliquée à la profondeur |
| 06 | Stable LatentMoE | 896 experts dans un espace latent |
| 07 | SiTU-GLU | L'activation bornée qui remplace SwiGLU |
| 08 | Quantile Balancing | L'équilibrage de charge exact |
| 09 | Vision native : MoonViT-V2 | L'encodeur visuel entraîné depuis zéro |
| 10 | Per-Head Muon | L'optimiseur, tête par tête |
Le tableau des innovations, et leur origine¶
| Composant | Nouveau dans K3 ? | Origine |
|---|---|---|
| KDA (principe) | Non | Kimi Linear, oct. 2025 |
| KDA à décroissance bornée | Oui | K3 |
| KDA à porte de rang plein | Oui | K3 |
| MLA | Non | DeepSeek-V2 |
| Gated MLA + NoPE | Partiellement | Kimi Linear |
| Attention Residuals | Oui | Papier Moonshot 2026, appliqué ici |
| LatentMoE | Non | Elango et al., 2026 |
| RMSNorm dans LatentMoE | Oui | K3 |
| SiTU-GLU | Oui | K3 |
| Quantile Balancing | Non (formalisé par K3) | Su Jianlin, blog |
| MoonViT depuis zéro | Oui | K3 |
| Per-Head Muon | Oui | K3 |
Partie précédente : Présentation · Partie suivante : Entraînement