Glossaire¶
Environ 120 termes, classés par thème. Chaque définition renvoie au chapitre qui la développe.
A¶
AET (Autonomous Execution Tasks) — Paradigme d'environnement RL de Kimi K3 : l'agent reçoit un objectif, des contraintes et un vérificateur, mais aucune trajectoire de référence. La récompense est ancrée dans l'état final vérifié. → Environnements RL
AgentENV — Système de sandboxes à base de microVM Firecracker développé pour Kimi K3. Checkpoint 133 ms, reprise 49 ms. Ouvert. → Sandboxes
Agent — Combinaison d'un modèle, d'un harnais qui exécute ses actions, et d'un environnement. Le modèle ne fait qu'émettre des demandes. → Agents et outils
all-gather / all-reduce / all-to-all — Communications collectives entre GPU.
all-reduce : chacun obtient la somme. all-gather : chacun obtient la
concaténation. all-to-all : chacun envoie un morceau différent à chacun.
→ Parallélismes
Ablation — Retirer un composant pour mesurer sa contribution. Le rapport Kimi K3 n'en publie aucune quantifiée pour ses six innovations architecturales.
AttnRes → voir Attention Residuals
Attention — Mécanisme par lequel chaque position accède sélectivement à toutes les positions précédentes, avec des poids dépendant des données. → Le Transformer
Attention Residuals (AttnRes) — Innovation de Kimi K3 : appliquer l'attention à la profondeur. Chaque couche récupère sélectivement des représentations de toutes les couches précédentes au lieu de les accumuler uniformément. → AttnRes
Auto-régressif — Un modèle dont la sortie à l'étape \(t\) devient l'entrée à l'étape \(t+1\).
B¶
BF16 (bfloat16) — Format flottant 16 bits à large plage dynamique (\(\pm 10^{38}\)), format de travail par défaut de Kimi K3.
Block AttnRes — Version déployée d'AttnRes : les couches sont regroupées en blocs (12 chez K3) ; l'attention ne porte que sur les représentations de blocs. Mémoire \(O(Nd)\) au lieu de \(O(Ld)\).
BPE (Byte Pair Encoding) — Algorithme de tokenisation : fusionner itérativement les paires de symboles les plus fréquentes, en partant des octets. → Tokenisation
Bulle de pipeline — Période d'inactivité d'un GPU en parallélisme de pipeline. Kimi K3 y loge le calcul de l'encodeur visuel.
C¶
Cache KV — Stockage des clés et valeurs des positions précédentes, pour éviter de les recalculer à chaque nouveau jeton. Croît linéairement avec la longueur. → Inférence
Cache de préfixe — Réutilisation du cache KV entre requêtes partageant un préfixe. Chez Kimi K3, tarifé 0,30 $/M contre 3,00 $/M hors cache. → Cache de préfixe hybride
Chunkwise (forme par blocs) — Reformulation d'une récurrence : série entre blocs, parallèle dans chaque bloc. Mathématiquement exacte, pas une approximation.
Compaction de contexte — Résumer l'historique quand le contexte sature. Opération avec perte. Chez K3 sur BrowseComp : 91,2 % avec, 90,4 % sans.
Contamination — Présence des réponses d'un banc dans les données d'entraînement. Non analysée dans le rapport Kimi K3.
Contexte (fenêtre de) — Nombre maximal de jetons traités en une requête. 1 048 576 chez Kimi K3.
CP (Context Parallelism) — Partitionner la séquence entre GPU. → KCP
CUTLASS — Bibliothèque C++/CUDA bas niveau de NVIDIA. Base de FlashKDA.
D¶
Decode — Phase de génération jeton par jeton. Limitée par la bande passante mémoire. À opposer au prefill.
Delta rule (règle delta) — Écrire en mémoire la différence entre ce qu'on veut mémoriser et ce qui est déjà là, au lieu d'ajouter aveuglément. \(\mathbf{S}_t = (\mathbf{I}-\beta_t\mathbf{k}_t\mathbf{k}_t^\top)\mathbf{S}_{t-1} + \beta_t\mathbf{k}_t\mathbf{v}_t^\top\) → Attention linéaire
Décodage spéculatif — Un petit modèle propose plusieurs jetons, le grand les vérifie en une passe. Sans perte : la distribution est exactement celle du grand modèle.
Décroissance (decay) — Facteur \(\mathbf{\alpha} \in (0,1)\) qui atténue l'état récurrent à chaque pas. Chez KDA, par canal et dépendant de l'entrée.
Décroissance bornée — Innovation K3 : \(\mathbf{g} = g_{\min}\sigma(e^{A}\mathbf{z})\) avec \(g_{\min} = -5\), ce qui garde le facteur de renormalisation sous \(e^{80}\) — dans la plage BF16 — et débloque les Tensor Cores sur toutes les tuiles.
DP (Data Parallelism) — Chaque GPU a une copie du modèle et traite un lot différent.
E¶
EAGLE-3 — Méthode de décodage spéculatif dont le brouillon est une unique couche de décodeur. Kimi K3 y affine sa couche MTP pré-entraînée.
Effort de raisonnement — low / high / max. Entraîné, pas réglé à
l'inférence : chaque niveau est un expert RL distinct, fusionné par MOPD.
→ Effort de raisonnement
Elo — Score relatif issu de comparaisons par paires. Sans sens absolu ; seuls les écarts comptent. Dérive avec l'accumulation de matchs.
Embedding — Vecteur appris représentant un jeton. Dimension 7 168 chez K3.
EP (Expert Parallelism) — Répartir les experts d'un MoE entre GPU. Deux
all-to-all par couche.
Expert mort — Expert ne recevant jamais de jeton, donc jamais entraîné. 33 M de paramètres perdus par expert mort chez K3.
Expert partagé — Expert toujours actif, à pleine largeur. 2 par couche chez Kimi K3.
Expert redondant — Copie temporaire d'un expert sur un rang qui n'en est pas propriétaire, pour équilibrer la charge. MoonEP prouve qu'il en faut au plus \(E/R\) par rang.
F¶
Firecracker — Hyperviseur de microVM léger d'AWS. Base d'AgentENV.
FlashKDA — Noyau CUTLASS par blocs qui recouvre le calcul intra-bloc et la propagation d'état inter-blocs, en exploitant le parallélisme entre têtes.
FP8 / FP4 / MXFP4 / MXFP8 — Formats de basse précision. Le préfixe MX (Microscaling) signifie un facteur d'échelle par bloc de 32 valeurs.
Fusion de noyaux (kernel fusion) — Combiner plusieurs opérations GPU en un seul programme, pour garder les valeurs intermédiaires en mémoire rapide.
G¶
Gated MLA — MLA augmentée d'une porte de sortie sigmoïde de rang plein. 24 couches chez Kimi K3, avec NoPE. → Gated MLA
GLU (Gated Linear Unit) — FFN où une branche « porte » module une branche « valeur », coordonnée par coordonnée.
GQA (Grouped-Query Attention) — Plusieurs têtes de requête partagent une paire clé/valeur. À distinguer de MLA.
GRM (Generative Reward Model) — Modèle juge qui produit explicitement une grille de critères avant de noter. Utilisé pour les tâches non vérifiables.
H¶
Harnais (harness, scaffold) — Le programme qui exécute les outils demandés par le modèle et remet les résultats dans le contexte. Change les scores de plusieurs points. → Comprendre les benchmarks
HBM — Mémoire principale d'un GPU. 80 Go et ~3 To/s sur H100.
Hachage chaîné — Le hachage du bloc \(n\) inclut celui du bloc \(n-1\). Garantit qu'une correspondance certifie tout le préfixe.
Hallucination — Production d'un contenu plausible mais faux. Mesurée chez K3 par le banc Faithfulness : 85,5 % de fidélité.
H20 — GPU NVIDIA conforme aux restrictions d'exportation vers la Chine. Certains bancs de Kimi K3 y sont recalibrés.
I–J¶
Instantané (snapshot) — Sauvegarde d'état de sandbox, pour la récupération d'erreur.
Jeton (token) — Unité élémentaire manipulée par le modèle : un sous-mot, pas un caractère ni un mot. 163 840 possibles chez K3.
K¶
KCP (KDA Context Parallelism) — Parallélisme de contexte pour KDA : chaque rang transmet deux quantités (transition cumulée \(\mathbf{M}\) et état local \(\widetilde{\mathbf{S}}\)), qui se composent associativement. Communication de taille fixe. Exact. → KCP
KDA (Kimi Delta Attention) — Attention linéaire à décroissance par canal et règle delta. 69 couches sur 93 chez Kimi K3. → KDA
Kimi Linear — Modèle Moonshot d'octobre 2025 (arXiv 2510.26692) qui introduit KDA. Kimi K3 en hérite l'ossature du mélange de jetons.
L¶
LatentMoE — MoE où les experts routés opèrent dans un espace latent plus étroit (\(\ell = 0{,}5\,d\)), ce qui divise par deux le trafic de communication. → Stable LatentMoE
LK (perte) — \(-\log\sum_x \min(p(x),q(x))\) : optimise directement le taux d'acceptation du décodage spéculatif, au lieu d'une divergence KL.
Logit — Score brut avant softmax.
Long horizon — Tâche s'étalant sur des centaines ou milliers d'appels d'outils. Le régime visé par Kimi K3.
M¶
MLA (Multi-head Latent Attention) — Attention où le cache KV est compressé en un vecteur latent unique (rang 512 chez K3), reconstruit à la volée. Origine : DeepSeek-V2.
MoE (Mixture-of-Experts) — Beaucoup de petits réseaux, quelques-uns activés par jeton. 896 experts, 16 actifs chez K3. → MoE
MoonEP — Schéma de parallélisme d'experts à équilibre parfait, avec experts redondants dynamiques. Borne prouvée \(E/R\). Ouvert. → MoonEP
MoonViT-V2 — Encodeur visuel de Kimi K3. 27 couches, 401 M de paramètres, entraîné depuis zéro par prédiction du jeton suivant.
MOPD (Multi-Teacher On-Policy Distillation) — Fusion des 9 experts RL en un modèle unique, par récompense dense de rapport de log-vraisemblances. → MOPD
MTP (Multi-Token Prediction) — Couche prédisant plusieurs jetons d'avance.
num_nextn_predict_layers: 0 dans le dépôt public de K3.
Muon — Optimiseur qui orthogonalise la matrice de momentum par itérations de Newton–Schulz. Per-Head Muon : par tête d'attention.
microVM — Machine virtuelle légère à noyau séparé. Isolation supérieure aux conteneurs, démarrage quasi aussi rapide.
N¶
Newton–Schulz — Itération polynomiale qui approche \(\mathbf{U}\mathbf{V}^\top\) sans calculer la SVD.
NoPE (No Position Encoding) — Aucun encodage positionnel explicite. Viable chez K3 parce que les couches KDA portent la position. Permet d'étendre le contexte sans modifier le modèle.
O–P¶
Off-policy (hors-politique) — Apprendre sur des données produites par une politique différente de celle qu'on met à jour. Régime imposé par le partial rollout.
On-policy — L'élève génère lui-même les trajectoires ; le professeur les note.
Partial rollout — Interrompre la génération dès qu'une fraction \(\lambda\) des trajectoires est terminée ; reprendre les autres à l'itération suivante.
Perplexité — \(e^{\mathcal{L}}\) : « entre combien de jetons le modèle hésite-t-il ? »
Pixel-shuffle — Fusion de carreaux voisins (\(2\times2\) chez K3) pour diviser par 4 le nombre de jetons visuels.
Porte (gate) — Valeur entre 0 et 1, dépendant de l'entrée, qui décide quelle fraction d'un signal passe.
PP (Pipeline Parallelism) — Répartir les couches entre GPU.
Prefill — Traitement de tout le texte d'entrée en une passe parallèle. Limité par le calcul.
Q¶
QAT (Quantization-Aware Training) — Entraîner avec la quantification simulée. Chez K3 : dès le SFT, RL inclus, ce qui supprime l'écart entraînement/inférence.
Quantile Balancing (QB) — Équilibrage de charge MoE qui fixe chaque biais au quantile exact donnant la charge cible. Aucun hyperparamètre. → QB
Quantification — Réduire le nombre de bits par poids. K3 : MXFP4 sur les seuls experts routés.
R¶
Rang faible (low-rank) — Remplacer une matrice \(m\times n\) par le produit de deux matrices de rang \(r \ll m,n\).
Récurrence — Calcul où l'état à l'étape \(t\) dépend de l'état à \(t-1\).
Résiduel (connexion) — \(\mathbf{h}_{l+1} = \mathbf{h}_l + f_l(\mathbf{h}_l)\). Chemin direct pour le gradient. AttnRes en est le remplacement chez K3.
Reward hacking — Le modèle maximise la métrique sans accomplir la tâche. Le rapport nomme les stratégies observées et les contre-mesures.
RMSNorm — Normalisation par la racine de la moyenne des carrés, sans soustraction de moyenne. Omniprésente chez K3.
RoPE — Encodage positionnel par rotation. Non utilisé par Kimi K3.
RLVR — RL à récompense vérifiable (les tests passent ou non).
S¶
Sandbox — Environnement isolé où un agent exécute du code. 51 219 741 créées pour Kimi K3.
SFT (Supervised Fine-Tuning) — Entraînement sur des conversations démonstratives, avec masquage de la perte sur les jetons d'entrée.
ShortConv — Convolution causale sur une petite fenêtre (noyau 4 chez K3), qui capture les motifs locaux courts.
SiTU-GLU — Activation de Kimi K3 : plafond doux \(\beta\tanh(x/\beta)\) sur les deux branches de SwiGLU. Sortie bornée à \(\beta_1\beta_2 = 100\). → SiTU-GLU
SM (Streaming Multiprocessor) — Unité de calcul indépendante d'un GPU. ~130 par H100.
Softmax — Transforme des logits en probabilités.
Softcap (plafond doux) — \(\beta\tanh(x/\beta)\) : quasi linéaire près de 0, borné à \(\pm\beta\), gradient non nul partout (contrairement à l'écrêtage dur).
Sparsité (rareté) — Rapport experts totaux / experts actifs. 56 chez K3.
SwiGLU — GLU à porte Swish. Standard depuis 2020. Remplacé par SiTU-GLU chez K3 car ses deux facteurs sont non bornés.
Swish (SiLU) — \(x\,\sigma(x)\).
T¶
Tensor Core — Unité GPU dédiée aux multiplications matricielles, ~10× plus rapide que le calcul générique. Toute la conception de KDA vise à les saturer.
Top-\(k\) — Sélectionner les \(k\) plus grandes valeurs.
TP (Tensor Parallelism) — Découper chaque matrice entre GPU. Communication à chaque couche.
TPP (Tokens Per Parameter) — Rapport jetons d'entraînement / paramètres. Non publié pour Kimi K3.
Transformer — Architecture de 2017 : mélange de jetons (attention) puis mélange de canaux (FFN), avec résidus.
TTFT (Time To First Token) — Délai avant le premier jeton. Le SLO qui compte le plus en interactif.
U–Z¶
UT (transformation) — Astuce algébrique qui linéarise la chaîne de projections delta dans un bloc. Dérivation dans Kimi Linear, pas dans le rapport K3.
ViT (Vision Transformer) — Transformer appliqué à des carreaux d'image.
Warp — Groupe de 32 threads GPU exécutant la même instruction. Unité d'ordonnancement réelle.
WarpDecode — Conception de noyau MoE centrée sur les jetons : chaque warp produit un neurone de sortie et diffuse ses poids depuis la mémoire.
Weight decay — Terme qui tire les poids vers zéro. 0,1 chez K3.
WSD (Warmup-Stable-Decay) — Calendrier de LR alternatif au cosinus. Kimi K3 conclut, après recherche indépendante par calendrier, que le cosinus gagne.
XTML (eXtensible Token Markup Language) — Format de conversation de Kimi K3.
Trois jetons réservés [open], [sep], [close] au lieu de balises textuelles.
→ XTML
ZeRO — Partitionnement des états d'optimiseur (1), gradients (2) et paramètres (3) entre rangs de parallélisme de données.
Retour aux annexes