Aller au contenu

Architecture de Kimi K3

C'est le cœur du wiki. Cette partie décrit ce que le modèle calcule, module par module, avec les formules du rapport et leur explication complète.

Prérequis

Les chapitres 04, 05, 06 et 07 des Fondations. Sans eux, les formules seront opaques.

Le principe organisateur

Le rapport formule l'architecture autour d'une idée unique : faire circuler l'information selon trois dimensions.

Dimension Mécanisme Chapitre
Longueur de séquence Attention hybride : 3 KDA + 1 Gated MLA par bloc 02, 03, 04
Profondeur du réseau Attention Residuals : chaque couche puise dans toutes les précédentes 05
Largeur du modèle Stable LatentMoE : 16 experts actifs sur 896 06, 07, 08

Auxquelles s'ajoutent la voie visuelle native (09) et l'optimiseur (10), qui n'est pas une couche mais fait partie de l'architecture au sens où le rapport l'entend.

La phrase à retenir

Kimi K2 était un Transformer MoE classique, en plus grand. Kimi K3 change les trois axes à la fois : le mélange de jetons n'est plus l'attention softmax, le résidu n'est plus une addition, et le MoE n'opère plus à la largeur du modèle.

Ordre de lecture

# Chapitre Ce qu'il apporte
01 Vue d'ensemble Le schéma complet, couche par couche
02 L'attention hybride 3:1 Pourquoi mélanger deux types d'attention
03 Kimi Delta Attention Le module central, formules complètes
04 Gated MLA et NoPE L'attention globale, et l'absence d'encodage positionnel
05 Attention Residuals L'attention appliquée à la profondeur
06 Stable LatentMoE 896 experts dans un espace latent
07 SiTU-GLU L'activation bornée qui remplace SwiGLU
08 Quantile Balancing L'équilibrage de charge exact
09 Vision native : MoonViT-V2 L'encodeur visuel entraîné depuis zéro
10 Per-Head Muon L'optimiseur, tête par tête

Le tableau des innovations, et leur origine

Composant Nouveau dans K3 ? Origine
KDA (principe) Non Kimi Linear, oct. 2025
KDA à décroissance bornée Oui K3
KDA à porte de rang plein Oui K3
MLA Non DeepSeek-V2
Gated MLA + NoPE Partiellement Kimi Linear
Attention Residuals Oui Papier Moonshot 2026, appliqué ici
LatentMoE Non Elango et al., 2026
RMSNorm dans LatentMoE Oui K3
SiTU-GLU Oui K3
Quantile Balancing Non (formalisé par K3) Su Jianlin, blog
MoonViT depuis zéro Oui K3
Per-Head Muon Oui K3

Partie précédente : Présentation · Partie suivante : Entraînement