Aller au contenu

Glossaire

Environ 120 termes, classés par thème. Chaque définition renvoie au chapitre qui la développe.

A

AET (Autonomous Execution Tasks) — Paradigme d'environnement RL de Kimi K3 : l'agent reçoit un objectif, des contraintes et un vérificateur, mais aucune trajectoire de référence. La récompense est ancrée dans l'état final vérifié. → Environnements RL

AgentENV — Système de sandboxes à base de microVM Firecracker développé pour Kimi K3. Checkpoint 133 ms, reprise 49 ms. Ouvert. → Sandboxes

Agent — Combinaison d'un modèle, d'un harnais qui exécute ses actions, et d'un environnement. Le modèle ne fait qu'émettre des demandes. → Agents et outils

all-gather / all-reduce / all-to-all — Communications collectives entre GPU. all-reduce : chacun obtient la somme. all-gather : chacun obtient la concaténation. all-to-all : chacun envoie un morceau différent à chacun. → Parallélismes

Ablation — Retirer un composant pour mesurer sa contribution. Le rapport Kimi K3 n'en publie aucune quantifiée pour ses six innovations architecturales.

AttnRes → voir Attention Residuals

Attention — Mécanisme par lequel chaque position accède sélectivement à toutes les positions précédentes, avec des poids dépendant des données. → Le Transformer

Attention Residuals (AttnRes) — Innovation de Kimi K3 : appliquer l'attention à la profondeur. Chaque couche récupère sélectivement des représentations de toutes les couches précédentes au lieu de les accumuler uniformément. → AttnRes

Auto-régressif — Un modèle dont la sortie à l'étape \(t\) devient l'entrée à l'étape \(t+1\).

B

BF16 (bfloat16) — Format flottant 16 bits à large plage dynamique (\(\pm 10^{38}\)), format de travail par défaut de Kimi K3.

Block AttnRes — Version déployée d'AttnRes : les couches sont regroupées en blocs (12 chez K3) ; l'attention ne porte que sur les représentations de blocs. Mémoire \(O(Nd)\) au lieu de \(O(Ld)\).

BPE (Byte Pair Encoding) — Algorithme de tokenisation : fusionner itérativement les paires de symboles les plus fréquentes, en partant des octets. → Tokenisation

Bulle de pipeline — Période d'inactivité d'un GPU en parallélisme de pipeline. Kimi K3 y loge le calcul de l'encodeur visuel.

C

Cache KV — Stockage des clés et valeurs des positions précédentes, pour éviter de les recalculer à chaque nouveau jeton. Croît linéairement avec la longueur. → Inférence

Cache de préfixe — Réutilisation du cache KV entre requêtes partageant un préfixe. Chez Kimi K3, tarifé 0,30 $/M contre 3,00 $/M hors cache. → Cache de préfixe hybride

Chunkwise (forme par blocs) — Reformulation d'une récurrence : série entre blocs, parallèle dans chaque bloc. Mathématiquement exacte, pas une approximation.

Compaction de contexte — Résumer l'historique quand le contexte sature. Opération avec perte. Chez K3 sur BrowseComp : 91,2 % avec, 90,4 % sans.

Contamination — Présence des réponses d'un banc dans les données d'entraînement. Non analysée dans le rapport Kimi K3.

Contexte (fenêtre de) — Nombre maximal de jetons traités en une requête. 1 048 576 chez Kimi K3.

CP (Context Parallelism) — Partitionner la séquence entre GPU. → KCP

CUTLASS — Bibliothèque C++/CUDA bas niveau de NVIDIA. Base de FlashKDA.

D

Decode — Phase de génération jeton par jeton. Limitée par la bande passante mémoire. À opposer au prefill.

Delta rule (règle delta) — Écrire en mémoire la différence entre ce qu'on veut mémoriser et ce qui est déjà là, au lieu d'ajouter aveuglément. \(\mathbf{S}_t = (\mathbf{I}-\beta_t\mathbf{k}_t\mathbf{k}_t^\top)\mathbf{S}_{t-1} + \beta_t\mathbf{k}_t\mathbf{v}_t^\top\) → Attention linéaire

Décodage spéculatif — Un petit modèle propose plusieurs jetons, le grand les vérifie en une passe. Sans perte : la distribution est exactement celle du grand modèle.

Décroissance (decay) — Facteur \(\mathbf{\alpha} \in (0,1)\) qui atténue l'état récurrent à chaque pas. Chez KDA, par canal et dépendant de l'entrée.

Décroissance bornée — Innovation K3 : \(\mathbf{g} = g_{\min}\sigma(e^{A}\mathbf{z})\) avec \(g_{\min} = -5\), ce qui garde le facteur de renormalisation sous \(e^{80}\) — dans la plage BF16 — et débloque les Tensor Cores sur toutes les tuiles.

DP (Data Parallelism) — Chaque GPU a une copie du modèle et traite un lot différent.

E

EAGLE-3 — Méthode de décodage spéculatif dont le brouillon est une unique couche de décodeur. Kimi K3 y affine sa couche MTP pré-entraînée.

Effort de raisonnement — low / high / max. Entraîné, pas réglé à l'inférence : chaque niveau est un expert RL distinct, fusionné par MOPD. → Effort de raisonnement

Elo — Score relatif issu de comparaisons par paires. Sans sens absolu ; seuls les écarts comptent. Dérive avec l'accumulation de matchs.

Embedding — Vecteur appris représentant un jeton. Dimension 7 168 chez K3.

EP (Expert Parallelism) — Répartir les experts d'un MoE entre GPU. Deux all-to-all par couche.

Expert mort — Expert ne recevant jamais de jeton, donc jamais entraîné. 33 M de paramètres perdus par expert mort chez K3.

Expert partagé — Expert toujours actif, à pleine largeur. 2 par couche chez Kimi K3.

Expert redondant — Copie temporaire d'un expert sur un rang qui n'en est pas propriétaire, pour équilibrer la charge. MoonEP prouve qu'il en faut au plus \(E/R\) par rang.

F

Firecracker — Hyperviseur de microVM léger d'AWS. Base d'AgentENV.

FlashKDA — Noyau CUTLASS par blocs qui recouvre le calcul intra-bloc et la propagation d'état inter-blocs, en exploitant le parallélisme entre têtes.

FP8 / FP4 / MXFP4 / MXFP8 — Formats de basse précision. Le préfixe MX (Microscaling) signifie un facteur d'échelle par bloc de 32 valeurs.

Fusion de noyaux (kernel fusion) — Combiner plusieurs opérations GPU en un seul programme, pour garder les valeurs intermédiaires en mémoire rapide.

G

Gated MLA — MLA augmentée d'une porte de sortie sigmoïde de rang plein. 24 couches chez Kimi K3, avec NoPE. → Gated MLA

GLU (Gated Linear Unit) — FFN où une branche « porte » module une branche « valeur », coordonnée par coordonnée.

GQA (Grouped-Query Attention) — Plusieurs têtes de requête partagent une paire clé/valeur. À distinguer de MLA.

GRM (Generative Reward Model) — Modèle juge qui produit explicitement une grille de critères avant de noter. Utilisé pour les tâches non vérifiables.

H

Harnais (harness, scaffold) — Le programme qui exécute les outils demandés par le modèle et remet les résultats dans le contexte. Change les scores de plusieurs points. → Comprendre les benchmarks

HBM — Mémoire principale d'un GPU. 80 Go et ~3 To/s sur H100.

Hachage chaîné — Le hachage du bloc \(n\) inclut celui du bloc \(n-1\). Garantit qu'une correspondance certifie tout le préfixe.

Hallucination — Production d'un contenu plausible mais faux. Mesurée chez K3 par le banc Faithfulness : 85,5 % de fidélité.

H20 — GPU NVIDIA conforme aux restrictions d'exportation vers la Chine. Certains bancs de Kimi K3 y sont recalibrés.

I–J

Instantané (snapshot) — Sauvegarde d'état de sandbox, pour la récupération d'erreur.

Jeton (token) — Unité élémentaire manipulée par le modèle : un sous-mot, pas un caractère ni un mot. 163 840 possibles chez K3.

K

KCP (KDA Context Parallelism) — Parallélisme de contexte pour KDA : chaque rang transmet deux quantités (transition cumulée \(\mathbf{M}\) et état local \(\widetilde{\mathbf{S}}\)), qui se composent associativement. Communication de taille fixe. Exact. → KCP

KDA (Kimi Delta Attention) — Attention linéaire à décroissance par canal et règle delta. 69 couches sur 93 chez Kimi K3. → KDA

Kimi Linear — Modèle Moonshot d'octobre 2025 (arXiv 2510.26692) qui introduit KDA. Kimi K3 en hérite l'ossature du mélange de jetons.

L

LatentMoE — MoE où les experts routés opèrent dans un espace latent plus étroit (\(\ell = 0{,}5\,d\)), ce qui divise par deux le trafic de communication. → Stable LatentMoE

LK (perte) — \(-\log\sum_x \min(p(x),q(x))\) : optimise directement le taux d'acceptation du décodage spéculatif, au lieu d'une divergence KL.

Logit — Score brut avant softmax.

Long horizon — Tâche s'étalant sur des centaines ou milliers d'appels d'outils. Le régime visé par Kimi K3.

M

MLA (Multi-head Latent Attention) — Attention où le cache KV est compressé en un vecteur latent unique (rang 512 chez K3), reconstruit à la volée. Origine : DeepSeek-V2.

MoE (Mixture-of-Experts) — Beaucoup de petits réseaux, quelques-uns activés par jeton. 896 experts, 16 actifs chez K3. → MoE

MoonEP — Schéma de parallélisme d'experts à équilibre parfait, avec experts redondants dynamiques. Borne prouvée \(E/R\). Ouvert. → MoonEP

MoonViT-V2 — Encodeur visuel de Kimi K3. 27 couches, 401 M de paramètres, entraîné depuis zéro par prédiction du jeton suivant.

MOPD (Multi-Teacher On-Policy Distillation) — Fusion des 9 experts RL en un modèle unique, par récompense dense de rapport de log-vraisemblances. → MOPD

MTP (Multi-Token Prediction) — Couche prédisant plusieurs jetons d'avance. num_nextn_predict_layers: 0 dans le dépôt public de K3.

Muon — Optimiseur qui orthogonalise la matrice de momentum par itérations de Newton–Schulz. Per-Head Muon : par tête d'attention.

microVM — Machine virtuelle légère à noyau séparé. Isolation supérieure aux conteneurs, démarrage quasi aussi rapide.

N

Newton–Schulz — Itération polynomiale qui approche \(\mathbf{U}\mathbf{V}^\top\) sans calculer la SVD.

NoPE (No Position Encoding) — Aucun encodage positionnel explicite. Viable chez K3 parce que les couches KDA portent la position. Permet d'étendre le contexte sans modifier le modèle.

O–P

Off-policy (hors-politique) — Apprendre sur des données produites par une politique différente de celle qu'on met à jour. Régime imposé par le partial rollout.

On-policy — L'élève génère lui-même les trajectoires ; le professeur les note.

Partial rollout — Interrompre la génération dès qu'une fraction \(\lambda\) des trajectoires est terminée ; reprendre les autres à l'itération suivante.

Perplexité — \(e^{\mathcal{L}}\) : « entre combien de jetons le modèle hésite-t-il ? »

Pixel-shuffle — Fusion de carreaux voisins (\(2\times2\) chez K3) pour diviser par 4 le nombre de jetons visuels.

Porte (gate) — Valeur entre 0 et 1, dépendant de l'entrée, qui décide quelle fraction d'un signal passe.

PP (Pipeline Parallelism) — Répartir les couches entre GPU.

Prefill — Traitement de tout le texte d'entrée en une passe parallèle. Limité par le calcul.

Q

QAT (Quantization-Aware Training) — Entraîner avec la quantification simulée. Chez K3 : dès le SFT, RL inclus, ce qui supprime l'écart entraînement/inférence.

Quantile Balancing (QB) — Équilibrage de charge MoE qui fixe chaque biais au quantile exact donnant la charge cible. Aucun hyperparamètre. → QB

Quantification — Réduire le nombre de bits par poids. K3 : MXFP4 sur les seuls experts routés.

R

Rang faible (low-rank) — Remplacer une matrice \(m\times n\) par le produit de deux matrices de rang \(r \ll m,n\).

Récurrence — Calcul où l'état à l'étape \(t\) dépend de l'état à \(t-1\).

Résiduel (connexion) — \(\mathbf{h}_{l+1} = \mathbf{h}_l + f_l(\mathbf{h}_l)\). Chemin direct pour le gradient. AttnRes en est le remplacement chez K3.

Reward hacking — Le modèle maximise la métrique sans accomplir la tâche. Le rapport nomme les stratégies observées et les contre-mesures.

RMSNorm — Normalisation par la racine de la moyenne des carrés, sans soustraction de moyenne. Omniprésente chez K3.

RoPE — Encodage positionnel par rotation. Non utilisé par Kimi K3.

RLVR — RL à récompense vérifiable (les tests passent ou non).

S

Sandbox — Environnement isolé où un agent exécute du code. 51 219 741 créées pour Kimi K3.

SFT (Supervised Fine-Tuning) — Entraînement sur des conversations démonstratives, avec masquage de la perte sur les jetons d'entrée.

ShortConv — Convolution causale sur une petite fenêtre (noyau 4 chez K3), qui capture les motifs locaux courts.

SiTU-GLU — Activation de Kimi K3 : plafond doux \(\beta\tanh(x/\beta)\) sur les deux branches de SwiGLU. Sortie bornée à \(\beta_1\beta_2 = 100\). → SiTU-GLU

SM (Streaming Multiprocessor) — Unité de calcul indépendante d'un GPU. ~130 par H100.

Softmax — Transforme des logits en probabilités.

Softcap (plafond doux) — \(\beta\tanh(x/\beta)\) : quasi linéaire près de 0, borné à \(\pm\beta\), gradient non nul partout (contrairement à l'écrêtage dur).

Sparsité (rareté) — Rapport experts totaux / experts actifs. 56 chez K3.

SwiGLU — GLU à porte Swish. Standard depuis 2020. Remplacé par SiTU-GLU chez K3 car ses deux facteurs sont non bornés.

Swish (SiLU) — \(x\,\sigma(x)\).

T

Tensor Core — Unité GPU dédiée aux multiplications matricielles, ~10× plus rapide que le calcul générique. Toute la conception de KDA vise à les saturer.

Top-\(k\) — Sélectionner les \(k\) plus grandes valeurs.

TP (Tensor Parallelism) — Découper chaque matrice entre GPU. Communication à chaque couche.

TPP (Tokens Per Parameter) — Rapport jetons d'entraînement / paramètres. Non publié pour Kimi K3.

Transformer — Architecture de 2017 : mélange de jetons (attention) puis mélange de canaux (FFN), avec résidus.

TTFT (Time To First Token) — Délai avant le premier jeton. Le SLO qui compte le plus en interactif.

U–Z

UT (transformation) — Astuce algébrique qui linéarise la chaîne de projections delta dans un bloc. Dérivation dans Kimi Linear, pas dans le rapport K3.

ViT (Vision Transformer) — Transformer appliqué à des carreaux d'image.

Warp — Groupe de 32 threads GPU exécutant la même instruction. Unité d'ordonnancement réelle.

WarpDecode — Conception de noyau MoE centrée sur les jetons : chaque warp produit un neurone de sortie et diffuse ses poids depuis la mémoire.

Weight decay — Terme qui tire les poids vers zéro. 0,1 chez K3.

WSD (Warmup-Stable-Decay) — Calendrier de LR alternatif au cosinus. Kimi K3 conclut, après recherche indépendante par calendrier, que le cosinus gagne.

XTML (eXtensible Token Markup Language) — Format de conversation de Kimi K3. Trois jetons réservés [open], [sep], [close] au lieu de balises textuelles. → XTML

ZeRO — Partitionnement des états d'optimiseur (1), gradients (2) et paramètres (3) entre rangs de parallélisme de données.


Retour aux annexes