Aller au contenu

Moonshot AI et la série Kimi

L'entreprise

Moonshot AI (月之暗面, « la face cachée de la lune ») est une entreprise chinoise d'intelligence artificielle. Son produit grand public s'appelle Kimi, du nom de ses modèles.

Sa signature technique, constante depuis 2024, tient en trois traits :

  1. Le contexte long comme priorité absolue. C'est l'argument de vente d'origine de Kimi, et le fil conducteur jusqu'à K3.
  2. La publication des poids de ses modèles phares, à contre-courant des laboratoires occidentaux.
  3. Des rapports techniques inhabituellement détaillés, en particulier sur l'infrastructure — là où la plupart des acteurs restent vagues.

Un point qui distingue Kimi K3

Le rapport K3 ne se contente pas de décrire : il ouvre du code. Sont publiés ou annoncés comme ouverts, avec liens dans le papier : MoonEP (bibliothèque de parallélisme d'experts), AgentENV (sandboxes microVM), MiniTriton (compilateur écrit par le modèle lui-même), nano-kpu (RTL d'une puce d'inférence), et une contribution KDA à flash-linear-attention et à vLLM.

La lignée technique

Chaque modèle de la série a introduit une brique qui se retrouve dans Kimi K3.

Modèle Date Apport principal Ce qu'il en reste dans K3
Kimi k1.5 janv. 2025 RL à grande échelle sur un modèle pré-entraîné fort ; partial rollout Le schéma de déploiement partiel, étendu au long horizon
Kimi K2 juil. 2025 MoE 1,04 T / 32,6 B actifs ; optimiseur Muon à l'échelle ; weight clipping ; recette de reformulation des données Muon (devenu Per-Head Muon), le weight clipping, les pipelines de données
Kimi Linear oct. 2025 Kimi Delta Attention ; hybride linéaire/global 3:1 ; NoPE sur les couches globales L'ossature complète du mélange de jetons de K3
Kimi K2.5 2026 Multimodalité (MoonViT-3D) ; Agent Swarm ; contrôle de budget de raisonnement La voie visuelle, le contrôle d'effort, le GRM en tournoi
Kimi K3 27 juil. 2026 AttnRes, Stable LatentMoE, SiTU-GLU, Quantile Balancing, MoonViT-V2, MoonEP —

Lecture importante

Kimi K3 n'invente pas KDA. KDA vient de Kimi Linear (arXiv 2510.26692, octobre 2025). K3 la modifie sur deux points précis — décroissance bornée par le bas, porte de sortie de rang plein — et la déploie à une échelle inédite. Comprendre Kimi Linear est donc un préalable utile ; le chapitre Kimi Delta Attention résume ce qui est nécessaire.

Les briques venues de l'extérieur

Un point d'honnêteté intellectuelle que le rapport respecte : plusieurs composants majeurs de Kimi K3 ne viennent pas de Moonshot.

Composant Origine Référence
MLA (Multi-head Latent Attention) DeepSeek-V2 arXiv 2405.04434
Experts partagés + routés DeepSeekMoE arXiv 2401.06066
Routage sans perte auxiliaire DeepSeek-V3 arXiv 2412.19437
LatentMoE Elango et al., 2026 arXiv 2601.18089
Quantile Balancing Su Jianlin, billet de blog (Travels in MoE, n° 6) spaces.ac.cn/archives/11619
Règle delta Schlag et al., 2021 Linear Transformers Are Secretly Fast Weight Programmers
Gated DeltaNet Yang et al., 2025 Base directe de KDA
Muon Jordan et al., 2024 —
EAGLE-3 Li et al., 2025 arXiv 2503.01840
Perte LK Samarin et al., 2026 arXiv 2602.23881
Firecracker AWS, 2020 Base d'AgentENV
MXFP4/MXFP8 Microscaling, 2023 arXiv 2310.10537

Ce que cela dit du domaine

Un modèle de frontière en 2026 est un assemblage. La contribution propre de Kimi K3 se situe à trois endroits : (a) trois ou quatre innovations algorithmiques réelles — AttnRes, SiTU-GLU, la décroissance bornée de KDA, MoonEP ; (b) l'intégration cohérente de l'ensemble ; (c) la mise à l'échelle, qui est un travail d'ingénierie considérable et rarement reproductible.

Fait notable : Quantile Balancing provient d'un billet de blog personnel d'un chercheur, cité comme tel. Le rapport en donne une dérivation complète en annexe, avec sa formulation duale et sa relation aux méthodes antérieures — un travail de formalisation qui ajoute une réelle valeur.

L'échelle du projet

Le rapport est signé « Kimi Team » et compte plus de 400 contributeurs nommés. Le papier fait 47 pages hors annexes et bibliographie, et sa bibliographie compte plusieurs centaines d'entrées.

Un ordre de grandeur révélateur

51 219 741 sandboxes créées pendant l'entraînement et l'évaluation, à partir de 1 505 678 images distinctes. Ce chiffre unique donne une idée de ce qu'est devenu l'entraînement d'un modèle de frontière : moins un calcul qu'une exploitation industrielle d'environnements simulés.

Chronologie détaillée

Voir Chronologie pour les dates précises et les liens vers chaque publication.


Chapitre suivant : Ce que Kimi K3 annonce