Moonshot AI et la série Kimi¶
L'entreprise¶
Moonshot AI (月之暗面, « la face cachée de la lune ») est une entreprise chinoise d'intelligence artificielle. Son produit grand public s'appelle Kimi, du nom de ses modèles.
Sa signature technique, constante depuis 2024, tient en trois traits :
- Le contexte long comme priorité absolue. C'est l'argument de vente d'origine de Kimi, et le fil conducteur jusqu'à K3.
- La publication des poids de ses modèles phares, à contre-courant des laboratoires occidentaux.
- Des rapports techniques inhabituellement détaillés, en particulier sur l'infrastructure — là où la plupart des acteurs restent vagues.
Un point qui distingue Kimi K3
Le rapport K3 ne se contente pas de décrire : il ouvre du code. Sont publiés ou annoncés comme ouverts, avec liens dans le papier : MoonEP (bibliothèque de parallélisme d'experts), AgentENV (sandboxes microVM), MiniTriton (compilateur écrit par le modèle lui-même), nano-kpu (RTL d'une puce d'inférence), et une contribution KDA à flash-linear-attention et à vLLM.
La lignée technique¶
Chaque modèle de la série a introduit une brique qui se retrouve dans Kimi K3.
| Modèle | Date | Apport principal | Ce qu'il en reste dans K3 |
|---|---|---|---|
| Kimi k1.5 | janv. 2025 | RL à grande échelle sur un modèle pré-entraîné fort ; partial rollout | Le schéma de déploiement partiel, étendu au long horizon |
| Kimi K2 | juil. 2025 | MoE 1,04 T / 32,6 B actifs ; optimiseur Muon à l'échelle ; weight clipping ; recette de reformulation des données | Muon (devenu Per-Head Muon), le weight clipping, les pipelines de données |
| Kimi Linear | oct. 2025 | Kimi Delta Attention ; hybride linéaire/global 3:1 ; NoPE sur les couches globales | L'ossature complète du mélange de jetons de K3 |
| Kimi K2.5 | 2026 | Multimodalité (MoonViT-3D) ; Agent Swarm ; contrôle de budget de raisonnement | La voie visuelle, le contrôle d'effort, le GRM en tournoi |
| Kimi K3 | 27 juil. 2026 | AttnRes, Stable LatentMoE, SiTU-GLU, Quantile Balancing, MoonViT-V2, MoonEP | — |
Lecture importante
Kimi K3 n'invente pas KDA. KDA vient de Kimi Linear (arXiv 2510.26692, octobre 2025). K3 la modifie sur deux points précis — décroissance bornée par le bas, porte de sortie de rang plein — et la déploie à une échelle inédite. Comprendre Kimi Linear est donc un préalable utile ; le chapitre Kimi Delta Attention résume ce qui est nécessaire.
Les briques venues de l'extérieur¶
Un point d'honnêteté intellectuelle que le rapport respecte : plusieurs composants majeurs de Kimi K3 ne viennent pas de Moonshot.
| Composant | Origine | Référence |
|---|---|---|
| MLA (Multi-head Latent Attention) | DeepSeek-V2 | arXiv 2405.04434 |
| Experts partagés + routés | DeepSeekMoE | arXiv 2401.06066 |
| Routage sans perte auxiliaire | DeepSeek-V3 | arXiv 2412.19437 |
| LatentMoE | Elango et al., 2026 | arXiv 2601.18089 |
| Quantile Balancing | Su Jianlin, billet de blog (Travels in MoE, n° 6) | spaces.ac.cn/archives/11619 |
| Règle delta | Schlag et al., 2021 | Linear Transformers Are Secretly Fast Weight Programmers |
| Gated DeltaNet | Yang et al., 2025 | Base directe de KDA |
| Muon | Jordan et al., 2024 | — |
| EAGLE-3 | Li et al., 2025 | arXiv 2503.01840 |
| Perte LK | Samarin et al., 2026 | arXiv 2602.23881 |
| Firecracker | AWS, 2020 | Base d'AgentENV |
| MXFP4/MXFP8 | Microscaling, 2023 | arXiv 2310.10537 |
Ce que cela dit du domaine
Un modèle de frontière en 2026 est un assemblage. La contribution propre de Kimi K3 se situe à trois endroits : (a) trois ou quatre innovations algorithmiques réelles — AttnRes, SiTU-GLU, la décroissance bornée de KDA, MoonEP ; (b) l'intégration cohérente de l'ensemble ; (c) la mise à l'échelle, qui est un travail d'ingénierie considérable et rarement reproductible.
Fait notable : Quantile Balancing provient d'un billet de blog personnel d'un chercheur, cité comme tel. Le rapport en donne une dérivation complète en annexe, avec sa formulation duale et sa relation aux méthodes antérieures — un travail de formalisation qui ajoute une réelle valeur.
L'échelle du projet¶
Le rapport est signé « Kimi Team » et compte plus de 400 contributeurs nommés. Le papier fait 47 pages hors annexes et bibliographie, et sa bibliographie compte plusieurs centaines d'entrées.
Un ordre de grandeur révélateur
51 219 741 sandboxes créées pendant l'entraînement et l'évaluation, à partir de 1 505 678 images distinctes. Ce chiffre unique donne une idée de ce qu'est devenu l'entraînement d'un modèle de frontière : moins un calcul qu'une exploitation industrielle d'environnements simulés.
Chronologie détaillée¶
Voir Chronologie pour les dates précises et les liens vers chaque publication.
Chapitre suivant : Ce que Kimi K3 annonce