Aller au contenu

Chronologie

La série Kimi et les travaux dont Kimi K3 dépend directement.

Sur les dates

Les dates des publications arXiv sont déduites de leurs identifiants (YYMM.numéro). Les dates sans référence vérifiable sont signalées comme telles.

La série Kimi

Date Modèle Apport Référence
janv. 2025 Kimi k1.5 RL à grande échelle sur un modèle pré-entraîné fort ; introduction du partial rollout arXiv 2501.12599
juil. 2025 Kimi K2 MoE 1,04 T / 32,6 B actifs ; Muon à l'échelle du billion ; weight clipping ; recette de reformulation des données arXiv 2507.20534
oct. 2025 Kimi Linear Kimi Delta Attention ; hybride linéaire/global 3:1 ; NoPE sur les couches globales arXiv 2510.26692
2026 Kimi K2.5 Multimodalité (MoonViT-3D) ; Agent Swarm ; contrôle de budget de raisonnement ; DEP Pas d'eprint dans la bibliographie du rapport
27 juil. 2026 Kimi K3 AttnRes, Stable LatentMoE, SiTU-GLU, Quantile Balancing, MoonViT-V2, MoonEP, décroissance bornée arXiv 2607.24653

La lignée technique en une phrase

k1.5 apporte le RL et le partial rollout · K2 apporte le MoE à l'échelle et Muon · Kimi Linear apporte KDA et l'hybride · K2.5 apporte la vision et l'effort · K3 assemble tout et ajoute AttnRes, LatentMoE stable et l'infrastructure 3T.

Les briques externes

Kimi K3 s'appuie sur des travaux qui ne viennent pas de Moonshot. Ordre chronologique.

Date Travail Ce que K3 en tire
2017 Attention Is All You Need Le Transformer
2020 Firecracker (AWS) Base des microVM d'AgentENV
2020 GLU Variants (Shazeer) SwiGLU, que SiTU-GLU modifie
2021 DeltaNet (Schlag et al.) La règle delta
2023 Microscaling (arXiv 2310.10537) Les formats MXFP4 / MXFP8
mai 2024 DeepSeek-V2 (arXiv 2405.04434) MLA
janv. 2024 DeepSeekMoE (arXiv 2401.06066) Experts partagés + routés
2024 Muon (Jordan et al.) L'optimiseur
déc. 2024 DeepSeek-V3 (arXiv 2412.19437) Routage sans perte auxiliaire
juil. 2024 Mooncake (arXiv 2407.00079) Le Transfer Engine
2025 Gated DeltaNet (Yang et al.) Base directe de KDA
mars 2025 EAGLE-3 (arXiv 2503.01840) Le modèle brouillon
mai 2025 Gated Attention (arXiv 2505.06708) Les portes de sortie
2025 On-policy distillation (Thinking Machines) Base de MOPD
2025 DeltaNet CP (Wang et al.) Base de KCP
janv. 2026 LatentMoE (arXiv 2601.18089) L'espace latent des experts
2026 Quantile Balancing (Su Jianlin, blog) Formalisé et démontré par K3
2026 Attention Residuals (Moonshot) AttnRes
fév. 2026 LK Losses (arXiv 2602.23881) La perte du brouillon
2026 Low-Precision Transformer Training Fails (arXiv 2510.04212) La sortie d'attention en FP32
2026 WarpDecode (Cursor) Le noyau MoE centré jetons
2026 ReplaySSM Le rejeu d'état — conçu indépendamment de K3
2026 FlashKDA Le noyau CUTLASS

Une remarque sur Quantile Balancing

QB provient d'un billet de blog personnel d'un chercheur (Su Jianlin, Travels in MoE, n° 6), cité comme tel par le rapport. Moonshot en produit la dérivation duale complète en annexe, ainsi que sa relation à SignSGD et à BIP.

C'est un cas intéressant de circulation des idées : une intuition publiée hors du circuit académique, formalisée et déployée à l'échelle industrielle en quelques mois.

Les jalons de la sortie de Kimi K3

Date Événement
13 juin 2026 Création du dépôt Hugging Face (date createdAt de l'API)
9 juil. 2026 Instantané des tâches SWE-Marathon utilisé pour l'évaluation
16 juil. 2026 Recalcul des scores FrontierSWE
~19 juil. 2026 Ouverture du vote sur l'Agent Arena
23 juil. 2026 Date de référence des scores tiers du rapport
24 juil. 2026 Date de référence Toolathlon et JobBench
26–27 juil. 2026 Publication des poids
27 juil. 2026 Soumission arXiv 2607.24653

Le paysage concurrentiel au moment de la sortie

Modèles évalués dans la suite de comparaison :

Modèle Éditeur Type
Claude Fable 5 Anthropic Propriétaire — leader général
GPT-5.6 Sol OpenAI Propriétaire
Claude Opus 4.8 Anthropic Propriétaire
GPT-5.5 OpenAI Propriétaire
GLM-5.2 Z.ai Poids ouverts
Kimi K3 Moonshot AI Poids ouverts

Une absence remarquée

Gemini n'apparaît dans aucune comparaison de Kimi K3 — alors que Gemini 3.1 Pro est utilisé comme juge sur MCP-Atlas. Le rapport ne l'explique pas.

Le rapport cite par ailleurs, dans son introduction, plusieurs modèles ouverts récents restant « dans ou légèrement au-dessus » de la classe du billion de paramètres : GLM-5, DeepSeek-V4, MiMo v2.5 Pro, Inkling (Thinking Machines). C'est l'argument central de sa thèse : l'écosystème ouvert a stagné sur l'axe du pré-entraînement.

Ce qui vient après

Ce wiki est daté

Il reflète l'état des connaissances au 29 juillet 2026, soit deux jours après la publication.

Les éléments les plus susceptibles d'évoluer :

  • les scores Elo (arènes), qui dérivent en permanence ;
  • le classement d'Artificial Analysis, qui ajoute des modèles ;
  • les reproductions indépendantes des scores de codage sous harnais commun, qui n'existent pas encore ;
  • les quantifications communautaires et leur qualité mesurée ;
  • d'éventuels correctifs au dépôt de poids (notamment sur la couche MTP).

Retour aux annexes