Infrastructure¶
Environ 40 % du rapport technique. C'est la partie que la plupart des résumés ignorent — et celle qui explique le mieux ce que coûte réellement un modèle de frontière.
Prérequis
Le chapitre Matériel et parallélismes des Fondations.
Les trois défis simultanés¶
Le rapport pose le problème d'emblée : Kimi K3 combine trois défis système rarement rencontrés dans un même modèle.
| Défi | Origine |
|---|---|
| Attention hybride KDA | Une récurrence série au cœur d'un modèle massivement parallèle |
| Entraînement et inférence multimodaux épars à l'échelle 3 T | 896 experts, 2,78 T de paramètres |
| Charges agentiques à un million de jetons | Trajectoires de plusieurs heures, état persistant |
L'infrastructure est co-conçue avec ces défis sur tout le cycle de vie du modèle.
La carte de la partie¶
┌──────────────────────────────────────────────────────┐
│ ARCHITECTURE : co-conception KDA │
│ • noyaux fusionnés (FlashKDA) → ch. 01 │
│ • KDA Context Parallelism (KCP) → ch. 02 │
└──────────────────────────────────────────────────────┘
┌──────────────────────────────────────────────────────┐
│ PRÉ-ENTRAÎNEMENT 3 T │
│ • MoonEP, équilibrage parfait → ch. 03 │
│ • mémoire et parallélismes → ch. 04 │
│ • encodeur multimodal → ch. 05 │
└──────────────────────────────────────────────────────┘
┌──────────────────────────────────────────────────────┐
│ RL AGENTIQUE À 1 M │
│ • cache KV externe, throttling → ch. 06 │
│ • sandboxes AgentENV → ch. 07 │
└──────────────────────────────────────────────────────┘
┌──────────────────────────────────────────────────────┐
│ SERVICE EN PRODUCTION │
│ • cache de préfixe hybride → ch. 08 │
│ • noyaux d'inférence → ch. 09 │
│ • ordonnancement de flotte → ch. 10 │
└──────────────────────────────────────────────────────┘
Ordre de lecture¶
| # | Chapitre | Problème résolu |
|---|---|---|
| 01 | Noyaux KDA et FlashKDA | La récurrence série gaspille les SM |
| 02 | KDA Context Parallelism | Partitionner une séquence de 1 M entre GPU |
| 03 | MoonEP : l'équilibrage parfait | Le déséquilibre de charge entre experts |
| 04 | Mémoire et parallélismes | Activations, gradients, états d'optimiseur |
| 05 | Encodeur multimodal | Le ViT sur le chemin critique |
| 06 | Infra pour le RL à 1 M | Contention mémoire entre rollout et entraînement |
| 07 | Sandboxes AgentENV | Des millions d'environnements isolés et reprenables |
| 08 | Cache de préfixe hybride | Deux caches incompatibles à réutiliser ensemble |
| 09 | Noyaux d'inférence | Décodage KDA, Block AttnRes, LatentMoE épars |
| 10 | Ordonnancement de flotte | Prédictibilité à l'échelle du service |
Le fil conducteur¶
La leçon générale du rapport
Chaque innovation algorithmique de Kimi K3 crée un ou plusieurs problèmes de systèmes :
| Innovation | Problèmes systèmes créés |
|---|---|
| KDA | 4 (noyaux, CP, spéculatif, cache) |
| AttnRes | 2 (mémoire d'activation, communication PP) |
| LatentMoE 896 experts | 2 (équilibrage, noyaux épars) |
| Contexte 1 M | 3 (CP, cache KV, ordonnancement) |
| Vision native | 2 (charge variable, chemin critique) |
Le rapport consacre autant de pages aux solutions qu'aux innovations. C'est le vrai coût d'un modèle de frontière : pas l'idée, mais tout ce qu'il faut construire pour qu'elle tourne.
Ce qui est ouvert¶
| Composant | Statut |
|---|---|
| MoonEP | Ouvert — github.com/MoonshotAI/MoonEP |
| AgentENV | Ouvert — github.com/kvcache-ai/AgentENV |
| KDA dans FLA | PR #691 de flash-linear-attention |
| Cache de préfixe KDA | Contribution annoncée à vLLM |
| FlashKDA | Cité comme référence 2026, dispatché comme backend de FLA |
| MoonEP (preuve \(E/R\)) | Démontrée en annexe du rapport |
Partie précédente : Entraînement · Partie suivante : Évaluations