Aller au contenu

Infrastructure

Environ 40 % du rapport technique. C'est la partie que la plupart des résumés ignorent — et celle qui explique le mieux ce que coûte réellement un modèle de frontière.

Prérequis

Le chapitre Matériel et parallélismes des Fondations.

Les trois défis simultanés

Le rapport pose le problème d'emblée : Kimi K3 combine trois défis système rarement rencontrés dans un même modèle.

Défi Origine
Attention hybride KDA Une récurrence série au cœur d'un modèle massivement parallèle
Entraînement et inférence multimodaux épars à l'échelle 3 T 896 experts, 2,78 T de paramètres
Charges agentiques à un million de jetons Trajectoires de plusieurs heures, état persistant

L'infrastructure est co-conçue avec ces défis sur tout le cycle de vie du modèle.

La carte de la partie

       ┌──────────────────────────────────────────────────────┐
       │  ARCHITECTURE : co-conception KDA                     │
       │   • noyaux fusionnés (FlashKDA)          → ch. 01     │
       │   • KDA Context Parallelism (KCP)        → ch. 02     │
       └──────────────────────────────────────────────────────┘
       ┌──────────────────────────────────────────────────────┐
       │  PRÉ-ENTRAÎNEMENT 3 T                                 │
       │   • MoonEP, équilibrage parfait          → ch. 03     │
       │   • mémoire et parallélismes             → ch. 04     │
       │   • encodeur multimodal                  → ch. 05     │
       └──────────────────────────────────────────────────────┘
       ┌──────────────────────────────────────────────────────┐
       │  RL AGENTIQUE À 1 M                                   │
       │   • cache KV externe, throttling         → ch. 06     │
       │   • sandboxes AgentENV                   → ch. 07     │
       └──────────────────────────────────────────────────────┘
       ┌──────────────────────────────────────────────────────┐
       │  SERVICE EN PRODUCTION                                │
       │   • cache de préfixe hybride             → ch. 08     │
       │   • noyaux d'inférence                   → ch. 09     │
       │   • ordonnancement de flotte             → ch. 10     │
       └──────────────────────────────────────────────────────┘

Ordre de lecture

# Chapitre Problème résolu
01 Noyaux KDA et FlashKDA La récurrence série gaspille les SM
02 KDA Context Parallelism Partitionner une séquence de 1 M entre GPU
03 MoonEP : l'équilibrage parfait Le déséquilibre de charge entre experts
04 Mémoire et parallélismes Activations, gradients, états d'optimiseur
05 Encodeur multimodal Le ViT sur le chemin critique
06 Infra pour le RL à 1 M Contention mémoire entre rollout et entraînement
07 Sandboxes AgentENV Des millions d'environnements isolés et reprenables
08 Cache de préfixe hybride Deux caches incompatibles à réutiliser ensemble
09 Noyaux d'inférence Décodage KDA, Block AttnRes, LatentMoE épars
10 Ordonnancement de flotte Prédictibilité à l'échelle du service

Le fil conducteur

La leçon générale du rapport

Chaque innovation algorithmique de Kimi K3 crée un ou plusieurs problèmes de systèmes :

Innovation Problèmes systèmes créés
KDA 4 (noyaux, CP, spéculatif, cache)
AttnRes 2 (mémoire d'activation, communication PP)
LatentMoE 896 experts 2 (équilibrage, noyaux épars)
Contexte 1 M 3 (CP, cache KV, ordonnancement)
Vision native 2 (charge variable, chemin critique)

Le rapport consacre autant de pages aux solutions qu'aux innovations. C'est le vrai coût d'un modèle de frontière : pas l'idée, mais tout ce qu'il faut construire pour qu'elle tourne.

Ce qui est ouvert

Composant Statut
MoonEP Ouvert — github.com/MoonshotAI/MoonEP
AgentENV Ouvert — github.com/kvcache-ai/AgentENV
KDA dans FLA PR #691 de flash-linear-attention
Cache de préfixe KDA Contribution annoncée à vLLM
FlashKDA Cité comme référence 2026, dispatché comme backend de FLA
MoonEP (preuve \(E/R\)) Démontrée en annexe du rapport

Partie précédente : Entraînement · Partie suivante : Évaluations