Chronologie¶
La série Kimi et les travaux dont Kimi K3 dépend directement.
Sur les dates
Les dates des publications arXiv sont déduites de leurs identifiants
(YYMM.numéro). Les dates sans référence vérifiable sont signalées comme
telles.
La série Kimi¶
| Date | Modèle | Apport | Référence |
|---|---|---|---|
| janv. 2025 | Kimi k1.5 | RL à grande échelle sur un modèle pré-entraîné fort ; introduction du partial rollout | arXiv 2501.12599 |
| juil. 2025 | Kimi K2 | MoE 1,04 T / 32,6 B actifs ; Muon à l'échelle du billion ; weight clipping ; recette de reformulation des données | arXiv 2507.20534 |
| oct. 2025 | Kimi Linear | Kimi Delta Attention ; hybride linéaire/global 3:1 ; NoPE sur les couches globales | arXiv 2510.26692 |
| 2026 | Kimi K2.5 | Multimodalité (MoonViT-3D) ; Agent Swarm ; contrôle de budget de raisonnement ; DEP | Pas d'eprint dans la bibliographie du rapport |
| 27 juil. 2026 | Kimi K3 | AttnRes, Stable LatentMoE, SiTU-GLU, Quantile Balancing, MoonViT-V2, MoonEP, décroissance bornée | arXiv 2607.24653 |
La lignée technique en une phrase
k1.5 apporte le RL et le partial rollout · K2 apporte le MoE à l'échelle et Muon · Kimi Linear apporte KDA et l'hybride · K2.5 apporte la vision et l'effort · K3 assemble tout et ajoute AttnRes, LatentMoE stable et l'infrastructure 3T.
Les briques externes¶
Kimi K3 s'appuie sur des travaux qui ne viennent pas de Moonshot. Ordre chronologique.
| Date | Travail | Ce que K3 en tire |
|---|---|---|
| 2017 | Attention Is All You Need | Le Transformer |
| 2020 | Firecracker (AWS) | Base des microVM d'AgentENV |
| 2020 | GLU Variants (Shazeer) | SwiGLU, que SiTU-GLU modifie |
| 2021 | DeltaNet (Schlag et al.) | La règle delta |
| 2023 | Microscaling (arXiv 2310.10537) | Les formats MXFP4 / MXFP8 |
| mai 2024 | DeepSeek-V2 (arXiv 2405.04434) | MLA |
| janv. 2024 | DeepSeekMoE (arXiv 2401.06066) | Experts partagés + routés |
| 2024 | Muon (Jordan et al.) | L'optimiseur |
| déc. 2024 | DeepSeek-V3 (arXiv 2412.19437) | Routage sans perte auxiliaire |
| juil. 2024 | Mooncake (arXiv 2407.00079) | Le Transfer Engine |
| 2025 | Gated DeltaNet (Yang et al.) | Base directe de KDA |
| mars 2025 | EAGLE-3 (arXiv 2503.01840) | Le modèle brouillon |
| mai 2025 | Gated Attention (arXiv 2505.06708) | Les portes de sortie |
| 2025 | On-policy distillation (Thinking Machines) | Base de MOPD |
| 2025 | DeltaNet CP (Wang et al.) | Base de KCP |
| janv. 2026 | LatentMoE (arXiv 2601.18089) | L'espace latent des experts |
| 2026 | Quantile Balancing (Su Jianlin, blog) | Formalisé et démontré par K3 |
| 2026 | Attention Residuals (Moonshot) | AttnRes |
| fév. 2026 | LK Losses (arXiv 2602.23881) | La perte du brouillon |
| 2026 | Low-Precision Transformer Training Fails (arXiv 2510.04212) | La sortie d'attention en FP32 |
| 2026 | WarpDecode (Cursor) | Le noyau MoE centré jetons |
| 2026 | ReplaySSM | Le rejeu d'état — conçu indépendamment de K3 |
| 2026 | FlashKDA | Le noyau CUTLASS |
Une remarque sur Quantile Balancing
QB provient d'un billet de blog personnel d'un chercheur (Su Jianlin, Travels in MoE, n° 6), cité comme tel par le rapport. Moonshot en produit la dérivation duale complète en annexe, ainsi que sa relation à SignSGD et à BIP.
C'est un cas intéressant de circulation des idées : une intuition publiée hors du circuit académique, formalisée et déployée à l'échelle industrielle en quelques mois.
Les jalons de la sortie de Kimi K3¶
| Date | Événement |
|---|---|
| 13 juin 2026 | Création du dépôt Hugging Face (date createdAt de l'API) |
| 9 juil. 2026 | Instantané des tâches SWE-Marathon utilisé pour l'évaluation |
| 16 juil. 2026 | Recalcul des scores FrontierSWE |
| ~19 juil. 2026 | Ouverture du vote sur l'Agent Arena |
| 23 juil. 2026 | Date de référence des scores tiers du rapport |
| 24 juil. 2026 | Date de référence Toolathlon et JobBench |
| 26–27 juil. 2026 | Publication des poids |
| 27 juil. 2026 | Soumission arXiv 2607.24653 |
Le paysage concurrentiel au moment de la sortie¶
Modèles évalués dans la suite de comparaison :
| Modèle | Éditeur | Type |
|---|---|---|
| Claude Fable 5 | Anthropic | Propriétaire — leader général |
| GPT-5.6 Sol | OpenAI | Propriétaire |
| Claude Opus 4.8 | Anthropic | Propriétaire |
| GPT-5.5 | OpenAI | Propriétaire |
| GLM-5.2 | Z.ai | Poids ouverts |
| Kimi K3 | Moonshot AI | Poids ouverts |
Une absence remarquée
Gemini n'apparaît dans aucune comparaison de Kimi K3 — alors que Gemini 3.1 Pro est utilisé comme juge sur MCP-Atlas. Le rapport ne l'explique pas.
Le rapport cite par ailleurs, dans son introduction, plusieurs modèles ouverts récents restant « dans ou légèrement au-dessus » de la classe du billion de paramètres : GLM-5, DeepSeek-V4, MiMo v2.5 Pro, Inkling (Thinking Machines). C'est l'argument central de sa thèse : l'écosystème ouvert a stagné sur l'axe du pré-entraînement.
Ce qui vient après¶
Ce wiki est daté
Il reflète l'état des connaissances au 29 juillet 2026, soit deux jours après la publication.
Les éléments les plus susceptibles d'évoluer :
- les scores Elo (arènes), qui dérivent en permanence ;
- le classement d'Artificial Analysis, qui ajoute des modèles ;
- les reproductions indépendantes des scores de codage sous harnais commun, qui n'existent pas encore ;
- les quantifications communautaires et leur qualité mesurée ;
- d'éventuels correctifs au dépôt de poids (notamment sur la couche MTP).
Retour aux annexes