Aller au contenu

Résumé exécutif

L'essentiel de Kimi K3 en 20 minutes. Chaque affirmation renvoie au chapitre qui la développe.


1. Ce que c'est

En une phrase

Un modèle Mixture-of-Experts de 2,78 billions de paramètres dont 104 milliards sont actifs par jeton, nativement multimodal (texte, image, vidéo), avec une fenêtre de contexte de 1 048 576 jetons, publié en poids ouverts par Moonshot AI le 27 juillet 2026.

C'est le premier modèle de la classe des 3 billions de paramètres dont les poids sont téléchargeables.

Valeur
Paramètres totaux / actifs 2,78 T / 104,2 G
Couches 93 (69 KDA + 24 Gated MLA)
Experts 896, dont 16 actifs + 2 partagés
Contexte 1 048 576 jetons
Taille du dépôt 1,56 To
Tarif API 0,30 / 3,00 $ (entrée) · 15,00 $ (sortie) par million
Licence Kimi K3 License — permissive, pas open source

→ Fiche technique complète


2. La thèse

Le rapport ouvre sur un argument stratégique.

Il existe deux axes de mise à l'échelle : entraîner de plus gros modèles (l'axe historique), et faire réfléchir plus longtemps au moment du déploiement (l'axe des modèles de raisonnement).

Le constat de Moonshot

L'écosystème ouvert a beaucoup avancé sur le second axe, mais stagne sur le premier : la plupart des modèles ouverts récents restent dans la classe du billion de paramètres.

Le risque énoncé : le progrès ouvert converge pendant que l'écart aux meilleurs systèmes propriétaires se creuse.

La réponse de Kimi K3 : pousser les deux axes ensemble — porter la fondation pré-entraînée à la classe des 3 billions, tout en poussant le RL, l'effort de raisonnement et l'interaction longue à 1 M de contexte.


3. L'architecture, en trois axes

Kimi K3 fait circuler l'information selon trois dimensions.

Axe séquence — l'attention hybride

bloc = [ KDA , KDA , KDA , Gated MLA ]   × 23   + 1 MLA finale  =  93 couches
69 couches KDA 24 couches Gated MLA
Coût en longueur Linéaire Quadratique
Mémoire par requête État fixe (~217 Mio) Cache croissant (~29 Gio à 1 M)
Rôle Récence, position, structure locale Rappel global exact
Position Implicite Aucune (NoPE)

La conséquence la plus élégante

Comme les couches KDA portent la position, les couches MLA n'ont besoin d'aucun encodage positionnel. Résultat : étendre le contexte de 8 K à 1 M ne demande aucune modification du modèle — ni rebasage RoPE, ni interpolation YaRN.

Kimi Delta Attention en une équation :

\[ \mathbf{S}_t = \underbrace{\left(\mathbf{I}-\beta_t\mathbf{k}_t\mathbf{k}_t^{\top}\right)}_{\text{② effacer}}\underbrace{\operatorname{Diag}(\mathbf{\alpha}_t)}_{\text{① oublier}}\mathbf{S}_{t-1} + \underbrace{\beta_t\mathbf{k}_t\mathbf{v}_t^{\top}}_{\text{③ écrire}} \]

→ KDA

Axe profondeur — Attention Residuals

Le résidu standard \(\mathbf{h}_l = \mathbf{h}_{l-1} + f(\mathbf{h}_{l-1})\) compresse toutes les couches précédentes dans un vecteur unique — le même goulot qu'un RNN dans le temps.

AttnRes applique le remède du Transformer à la profondeur : chaque couche récupère sélectivement, par attention, des représentations de toutes les couches précédentes.

Coût : 667 000 paramètres, soit 0,00002 % du modèle.

→ AttnRes

Axe largeur — Stable LatentMoE

896 experts par couche, 16 actifs. Mais les experts routés opèrent dans un espace latent de dimension \(\ell = 3584\) au lieu de \(d = 7168\) : deux fois moins de trafic de communication pour deux fois plus d'experts actifs.

Trois stabilisateurs pour tenir à cette échelle :

Composant Rôle
RMSNorm avant \(\mathbf{W}^{\uparrow}\) Empêche l'explosion d'activation de la branche routée
SiTU-GLU Borne les activations à \(\beta_1\beta_2 = 100\)
Quantile Balancing Équilibre 896 experts, sans aucun hyperparamètre

→ Stable LatentMoE


4. Le post-entraînement

SFT  ──►  RL × 9 experts  ──►  MOPD  ──►  modèle unifié
(+QAT)    3 domaines × 3 efforts        (distillation on-policy)
  • 9 experts RL : 3 domaines (général, agents, code) × 3 niveaux d'effort (low, high, max).
  • L'effort est entraîné, pas réglé : chaque niveau résulte d'un curriculum sur un budget de jetons, où dépasser le budget donne une récompense de \(-1\).
  • MOPD fusionne les neuf en un seul, par récompense dense de rapport de log-vraisemblances.
  • QAT MXFP4 dès le SFT, RL inclus — ce qui supprime l'écart entraînement/inférence.

Les environnements RL, la vraie différenciation

  • 51 219 741 sandboxes créées, à partir de 1 505 678 images.
  • Environnement en boîte blanche : le harnais est recomposable, pour ne pas surapprendre une convention unique.
  • AET : la récompense est ancrée dans l'état final vérifié, jamais dans l'auto-déclaration de l'agent.
  • Détection de triche nommée et continuellement étendue.

→ Entraînement


5. L'infrastructure

40 % du rapport. Chaque innovation architecturale crée des problèmes de systèmes.

Innovation Problèmes créés Solutions
KDA 4 FlashKDA, KCP, rejeu d'état, cache hybride
AttnRes 2 Checkpointing intégral, communication par cache
896 experts 2 MoonEP, noyaux WarpDecode
Contexte 1 M 3 KCP, cache KV externe, ordonnancement par budget

Le résultat le plus solide

MoonEP prouve qu'au plus \(E/R\) experts redondants par rang suffisent toujours pour un équilibre parfait, et que cette borne est quasi atteinte. Réserver \(E/R\) emplacements garantit donc que l'entraînement n'est jamais interrompu — là où les méthodes antérieures doivent s'arrêter quand aucun plan ne rentre dans leur plafond.

Code ouvert.

→ Infrastructure


6. Les résultats

Ce que disent les tiers indépendants

Évaluation Résultat
Artificial Analysis Intelligence Index v4.1 57,1 — #4 sur 580 modèles
Vals AI Index (tâches professionnelles) 74,7 % — #2 sur 39
LMArena WebDev Arena 1 678 Elo — #1 sur 99
LMArena Text Arena 1 486 Elo — #8 sur 200
LMArena Agent Arena 9,1 — #4 sur 37

Le résultat le plus solide du dossier

Premier au monde sur le développement web, par vote humain indépendant — et premier modèle ouvert à occuper cette place.

Ce résultat converge avec la mesure interne (+59,1 points face à Claude Opus 4.8 sur les tâches 3D/WebGL, en jugement aveugle par experts) et avec une explication causale identifiable : le corpus de code visuel et le RL sur des tâches web à récompense mixte.

Le profil de capacités

Domaines
Fort Agents, recherche d'information, outillage, code long-horizon, documents, vidéo, développement web
Parité Raisonnement scientifique structuré, usage d'ordinateur standard
Faible Raisonnement de niveau recherche, travail de connaissance jugé par Elo, usage d'ordinateur difficile, qualité du processus

Le coût

  • Sur BrowseComp : meilleur score (91,2 %) et coût le plus bas (2,03 $/tâche — la moitié de GPT-5.6 Sol).
  • Sur Kimi Code Bench 2.0 : 4 points derrière Claude Fable 5 pour 38 % de son coût ; à effort high, égale déjà Claude Opus 4.8 en max pour un tiers du prix.

Une nuance

Kimi K3 est le moins cher de son niveau de capacité et le plus cher et le plus lent parmi les modèles ouverts (Artificial Analysis relève une consommation élevée de jetons de sortie et une vitesse sous la médiane). Les deux sont vrais.

→ Évaluations


7. Ce qui est solide, ce qui ne l'est pas

Solide

  • L'architecture est vérifiable. Nous avons reconstruit les 2,78 T de paramètres à 0,2 % près depuis le seul config.json, et vérifié l'identité de composition de KCP à \(6{,}94\times10^{-18}\) près.
  • Les preuves sont réelles : théorème MoonEP, dérivation duale de QB.
  • Du code est ouvert : MoonEP, AgentENV, MiniTriton, nano-kpu.
  • Les tiers confirment le positionnement.
  • L'évaluation cyber est sérieuse — étalonnée en heures-expert et confirmée par le UK AISI et le NIST CAISI.

Non solide

  • Le « 2,5× d'efficacité d'échelle » n'est pas vérifiable : figure sans axes, jeu de validation non publié, aucune ablation, gain attribué conjointement à l'architecture et aux données.
  • Les données sont un trou noir : ni volume, ni proportions, ni sources, ni date de coupure, ni analyse de contamination.
  • L'algorithme de RL n'est pas formulé — le mécanisme central du RL long-horizon est décrit en prose, sans équation.
  • Aucune ablation n'est publiée pour les six innovations architecturales. On ne peut donc pas savoir laquelle vaut la peine d'être reprise.
  • Les scores de codage mélangent les harnais.
  • Aucun budget de calcul.

→ Affirmations à vérifier


8. Les cinq chiffres à retenir

Chiffre Signification
2,78 T / 104 G Paramètres totaux / actifs — 3,7 % du modèle par jeton
1 048 576 Jetons de contexte, sans aucune modification d'encodage positionnel
69 / 24 Couches KDA / MLA — 74 % de la profondeur en attention linéaire
896 / 16 Experts totaux / actifs — 98 % des paramètres sont des experts
51 219 741 Sandboxes créées pour l'entraînement

9. La question de fond

Kimi K3 change-t-il quelque chose ?

Oui, sur un point précis : c'est le premier modèle de la classe des 3 billions dont les poids sont publics. L'écart aux meilleurs propriétaires est réel mais modeste — 2,8 points d'indice Artificial Analysis, 0,4 point d'indice Vals — et sur un domaine, Kimi K3 est premier au monde.

Non, sur la méthode. Le rapport est plus généreux que la moyenne sur l'architecture et l'infrastructure, et exactement aussi silencieux que les autres sur les données, les hyperparamètres et le calcul.

Il n'inverse pas la tendance à la fermeture scientifique du domaine. Il l'accompagne, en ouvrant les poids.


Pour aller plus loin

Vous voulez… Allez à
Comprendre les bases Fondations
Le détail de l'architecture Architecture
Réimplémenter Reproduire
Juger les revendications Analyse critique
Un chiffre précis Tableau des spécifications
Un terme Glossaire

Chapitre précédent : Parcours de lecture