Résumé exécutif¶
L'essentiel de Kimi K3 en 20 minutes. Chaque affirmation renvoie au chapitre qui la développe.
1. Ce que c'est¶
En une phrase
Un modèle Mixture-of-Experts de 2,78 billions de paramètres dont 104 milliards sont actifs par jeton, nativement multimodal (texte, image, vidéo), avec une fenêtre de contexte de 1 048 576 jetons, publié en poids ouverts par Moonshot AI le 27 juillet 2026.
C'est le premier modèle de la classe des 3 billions de paramètres dont les poids sont téléchargeables.
| Valeur | |
|---|---|
| Paramètres totaux / actifs | 2,78 T / 104,2 G |
| Couches | 93 (69 KDA + 24 Gated MLA) |
| Experts | 896, dont 16 actifs + 2 partagés |
| Contexte | 1 048 576 jetons |
| Taille du dépôt | 1,56 To |
| Tarif API | 0,30 / 3,00 $ (entrée) · 15,00 $ (sortie) par million |
| Licence | Kimi K3 License — permissive, pas open source |
2. La thèse¶
Le rapport ouvre sur un argument stratégique.
Il existe deux axes de mise à l'échelle : entraîner de plus gros modèles (l'axe historique), et faire réfléchir plus longtemps au moment du déploiement (l'axe des modèles de raisonnement).
Le constat de Moonshot
L'écosystème ouvert a beaucoup avancé sur le second axe, mais stagne sur le premier : la plupart des modèles ouverts récents restent dans la classe du billion de paramètres.
Le risque énoncé : le progrès ouvert converge pendant que l'écart aux meilleurs systèmes propriétaires se creuse.
La réponse de Kimi K3 : pousser les deux axes ensemble — porter la fondation pré-entraînée à la classe des 3 billions, tout en poussant le RL, l'effort de raisonnement et l'interaction longue à 1 M de contexte.
3. L'architecture, en trois axes¶
Kimi K3 fait circuler l'information selon trois dimensions.
Axe séquence — l'attention hybride¶
bloc = [ KDA , KDA , KDA , Gated MLA ] × 23 + 1 MLA finale = 93 couches
| 69 couches KDA | 24 couches Gated MLA | |
|---|---|---|
| Coût en longueur | Linéaire | Quadratique |
| Mémoire par requête | État fixe (~217 Mio) | Cache croissant (~29 Gio à 1 M) |
| Rôle | Récence, position, structure locale | Rappel global exact |
| Position | Implicite | Aucune (NoPE) |
La conséquence la plus élégante
Comme les couches KDA portent la position, les couches MLA n'ont besoin d'aucun encodage positionnel. Résultat : étendre le contexte de 8 K à 1 M ne demande aucune modification du modèle — ni rebasage RoPE, ni interpolation YaRN.
Kimi Delta Attention en une équation :
→ KDA
Axe profondeur — Attention Residuals¶
Le résidu standard \(\mathbf{h}_l = \mathbf{h}_{l-1} + f(\mathbf{h}_{l-1})\) compresse toutes les couches précédentes dans un vecteur unique — le même goulot qu'un RNN dans le temps.
AttnRes applique le remède du Transformer à la profondeur : chaque couche récupère sélectivement, par attention, des représentations de toutes les couches précédentes.
Coût : 667 000 paramètres, soit 0,00002 % du modèle.
→ AttnRes
Axe largeur — Stable LatentMoE¶
896 experts par couche, 16 actifs. Mais les experts routés opèrent dans un espace latent de dimension \(\ell = 3584\) au lieu de \(d = 7168\) : deux fois moins de trafic de communication pour deux fois plus d'experts actifs.
Trois stabilisateurs pour tenir à cette échelle :
| Composant | Rôle |
|---|---|
| RMSNorm avant \(\mathbf{W}^{\uparrow}\) | Empêche l'explosion d'activation de la branche routée |
| SiTU-GLU | Borne les activations à \(\beta_1\beta_2 = 100\) |
| Quantile Balancing | Équilibre 896 experts, sans aucun hyperparamètre |
4. Le post-entraînement¶
SFT ──► RL × 9 experts ──► MOPD ──► modèle unifié
(+QAT) 3 domaines × 3 efforts (distillation on-policy)
- 9 experts RL : 3 domaines (général, agents, code) × 3 niveaux d'effort
(
low,high,max). - L'effort est entraîné, pas réglé : chaque niveau résulte d'un curriculum sur un budget de jetons, où dépasser le budget donne une récompense de \(-1\).
- MOPD fusionne les neuf en un seul, par récompense dense de rapport de log-vraisemblances.
- QAT MXFP4 dès le SFT, RL inclus — ce qui supprime l'écart entraînement/inférence.
Les environnements RL, la vraie différenciation
- 51 219 741 sandboxes créées, à partir de 1 505 678 images.
- Environnement en boîte blanche : le harnais est recomposable, pour ne pas surapprendre une convention unique.
- AET : la récompense est ancrée dans l'état final vérifié, jamais dans l'auto-déclaration de l'agent.
- Détection de triche nommée et continuellement étendue.
5. L'infrastructure¶
40 % du rapport. Chaque innovation architecturale crée des problèmes de systèmes.
| Innovation | Problèmes créés | Solutions |
|---|---|---|
| KDA | 4 | FlashKDA, KCP, rejeu d'état, cache hybride |
| AttnRes | 2 | Checkpointing intégral, communication par cache |
| 896 experts | 2 | MoonEP, noyaux WarpDecode |
| Contexte 1 M | 3 | KCP, cache KV externe, ordonnancement par budget |
Le résultat le plus solide
MoonEP prouve qu'au plus \(E/R\) experts redondants par rang suffisent toujours pour un équilibre parfait, et que cette borne est quasi atteinte. Réserver \(E/R\) emplacements garantit donc que l'entraînement n'est jamais interrompu — là où les méthodes antérieures doivent s'arrêter quand aucun plan ne rentre dans leur plafond.
Code ouvert.
6. Les résultats¶
Ce que disent les tiers indépendants¶
| Évaluation | Résultat |
|---|---|
| Artificial Analysis Intelligence Index v4.1 | 57,1 — #4 sur 580 modèles |
| Vals AI Index (tâches professionnelles) | 74,7 % — #2 sur 39 |
| LMArena WebDev Arena | 1 678 Elo — #1 sur 99 |
| LMArena Text Arena | 1 486 Elo — #8 sur 200 |
| LMArena Agent Arena | 9,1 — #4 sur 37 |
Le résultat le plus solide du dossier
Premier au monde sur le développement web, par vote humain indépendant — et premier modèle ouvert à occuper cette place.
Ce résultat converge avec la mesure interne (+59,1 points face à Claude Opus 4.8 sur les tâches 3D/WebGL, en jugement aveugle par experts) et avec une explication causale identifiable : le corpus de code visuel et le RL sur des tâches web à récompense mixte.
Le profil de capacités¶
| Domaines | |
|---|---|
| Fort | Agents, recherche d'information, outillage, code long-horizon, documents, vidéo, développement web |
| Parité | Raisonnement scientifique structuré, usage d'ordinateur standard |
| Faible | Raisonnement de niveau recherche, travail de connaissance jugé par Elo, usage d'ordinateur difficile, qualité du processus |
Le coût¶
- Sur BrowseComp : meilleur score (91,2 %) et coût le plus bas (2,03 $/tâche — la moitié de GPT-5.6 Sol).
- Sur Kimi Code Bench 2.0 : 4 points derrière Claude Fable 5 pour 38 % de
son coût ; à effort
high, égale déjà Claude Opus 4.8 enmaxpour un tiers du prix.
Une nuance
Kimi K3 est le moins cher de son niveau de capacité et le plus cher et le plus lent parmi les modèles ouverts (Artificial Analysis relève une consommation élevée de jetons de sortie et une vitesse sous la médiane). Les deux sont vrais.
7. Ce qui est solide, ce qui ne l'est pas¶
Solide
- L'architecture est vérifiable. Nous avons reconstruit les 2,78 T de
paramètres à 0,2 % près depuis le seul
config.json, et vérifié l'identité de composition de KCP à \(6{,}94\times10^{-18}\) près. - Les preuves sont réelles : théorème MoonEP, dérivation duale de QB.
- Du code est ouvert : MoonEP, AgentENV, MiniTriton, nano-kpu.
- Les tiers confirment le positionnement.
- L'évaluation cyber est sérieuse — étalonnée en heures-expert et confirmée par le UK AISI et le NIST CAISI.
Non solide
- Le « 2,5× d'efficacité d'échelle » n'est pas vérifiable : figure sans axes, jeu de validation non publié, aucune ablation, gain attribué conjointement à l'architecture et aux données.
- Les données sont un trou noir : ni volume, ni proportions, ni sources, ni date de coupure, ni analyse de contamination.
- L'algorithme de RL n'est pas formulé — le mécanisme central du RL long-horizon est décrit en prose, sans équation.
- Aucune ablation n'est publiée pour les six innovations architecturales. On ne peut donc pas savoir laquelle vaut la peine d'être reprise.
- Les scores de codage mélangent les harnais.
- Aucun budget de calcul.
8. Les cinq chiffres à retenir¶
| Chiffre | Signification |
|---|---|
| 2,78 T / 104 G | Paramètres totaux / actifs — 3,7 % du modèle par jeton |
| 1 048 576 | Jetons de contexte, sans aucune modification d'encodage positionnel |
| 69 / 24 | Couches KDA / MLA — 74 % de la profondeur en attention linéaire |
| 896 / 16 | Experts totaux / actifs — 98 % des paramètres sont des experts |
| 51 219 741 | Sandboxes créées pour l'entraînement |
9. La question de fond¶
Kimi K3 change-t-il quelque chose ?
Oui, sur un point précis : c'est le premier modèle de la classe des 3 billions dont les poids sont publics. L'écart aux meilleurs propriétaires est réel mais modeste — 2,8 points d'indice Artificial Analysis, 0,4 point d'indice Vals — et sur un domaine, Kimi K3 est premier au monde.
Non, sur la méthode. Le rapport est plus généreux que la moyenne sur l'architecture et l'infrastructure, et exactement aussi silencieux que les autres sur les données, les hyperparamètres et le calcul.
Il n'inverse pas la tendance à la fermeture scientifique du domaine. Il l'accompagne, en ouvrant les poids.
Pour aller plus loin¶
| Vous voulez… | Allez à |
|---|---|
| Comprendre les bases | Fondations |
| Le détail de l'architecture | Architecture |
| Réimplémenter | Reproduire |
| Juger les revendications | Analyse critique |
| Un chiffre précis | Tableau des spécifications |
| Un terme | Glossaire |
Chapitre précédent : Parcours de lecture