Ce que Kimi K3 annonce¶
Ce chapitre liste les revendications du rapport et qualifie chacune : est-ce un fait vérifiable, une mesure interne, ou une interprétation ?
C'est une exigence méthodologique : un rapport technique publié par le constructeur d'un modèle n'est pas une évaluation indépendante.
Les quatre contributions revendiquées¶
Le rapport les énonce explicitement en introduction.
1. « Pré-entraînement à la frontière ouverte »¶
Un modèle MoE multimodal natif de 2,8 T de paramètres, 104 B activés, fenêtre de 1 M de jetons. KDA, AttnRes, Stable LatentMoE et les recettes raffinées améliorent collectivement l'efficacité d'échelle d'environ 2,5× par rapport à Kimi K2.
| Élément | Statut |
|---|---|
| 2,8 T / 104 B / 1 M | Fait vérifiable. Reconstruit à 0,2 % près depuis le config.json publié — voir Retrouver les paramètres |
| Multimodal natif | Fait vérifiable. Confirmé par la configuration (KimiK3ForConditionalGeneration, vision_config) |
| « 2,5× d'efficacité d'échelle » | Mesure interne non reproductible. Figure sans axes chiffrés, jeu de validation OOD non publié, aucune ablation par composant |
2. « RL pour le passage à l'échelle multi-effort »¶
RL sur les domaines généraux, agentiques et de code, à plusieurs niveaux d'effort, puis consolidation en un modèle unifié.
| Élément | Statut |
|---|---|
| 9 experts (3 domaines × 3 efforts) | Fait déclaré, cohérent avec l'API (reasoning_effort: low/high/max) |
| MOPD comme méthode de fusion | Fait déclaré, formule de récompense publiée |
| L'algorithme de RL lui-même | Non publié. Le rapport renvoie à Kimi K2.5 et mentionne « une régularisation par jeton » sans la formuler |
3. « Infrastructure pour l'intelligence multi-billions / million-jetons »¶
Co-conception KDA, MoonEP, système RL colocalisé avec sandboxes reprenables, et d'autres innovations.
| Élément | Statut |
|---|---|
| MoonEP, borne \(E/R\) d'experts redondants | Fait vérifiable. Théorème démontré en annexe, code annoncé ouvert |
| AgentENV, latences 133 ms / 49 ms | Mesure interne, mais le code est ouvert et donc auditable |
| 51 219 741 sandboxes | Mesure interne invérifiable, mais sans enjeu de comparaison |
| KCP, cache de préfixe hybride | Fait vérifiable partiellement : une PR est référencée dans flash-linear-attention, la contribution vLLM est annoncée |
4. « Un modèle de frontière ouvert »¶
| Élément | Statut |
|---|---|
| Poids publiés | Fait vérifiable. 1,56 To sur Hugging Face, 118 fichiers |
| « Ouvert » | Contestable. La licence n'est pas une licence open source au sens de l'OSI — voir Licence |
Le tableau des chiffres les plus cités¶
| Affirmation | Source | Fiabilité |
|---|---|---|
| 2,8 T paramètres, 104 B actifs | Rapport + config publiée | ★★★ Vérifié |
| Contexte 1 M | Rapport + config (1048576) |
★★★ Vérifié |
| 2,5× d'efficacité d'échelle vs K2 | Rapport, fig. 3 | ★☆☆ Non reproductible |
| 93 couches = 69 KDA + 24 MLA | Rapport + config (full_attn_layers) |
★★★ Vérifié |
| 896 experts, 16 actifs | Rapport + config | ★★★ Vérifié |
| BrowseComp 91,2 % | Évaluation interne Moonshot | ★★☆ Interne, méthodologie décrite |
| Intelligence Index v4.1 = 57,1 (#4/580) | Artificial Analysis | ★★★ Tiers indépendant |
| WebDev Arena #1/99 (1 678 Elo) | LMArena | ★★★ Tiers, préférence humaine |
| Vals Index 74,7 % (#2/39) | Vals AI | ★★★ Tiers indépendant |
| 16 vulnérabilités inédites trouvées | Évaluation interne | ★☆☆ Interne, non détaillée |
| Coût : moitié de GPT-5.6 Sol sur BrowseComp | Mesure interne + prix publiés | ★★☆ Mélange de sources |
Les capacités mises en avant¶
Au-delà des chiffres, le rapport insiste sur cinq comportements :
- Codage long-horizon — sessions d'ingénierie prolongées avec supervision humaine minimale : optimisation de noyaux GPU, développement de compilateur, jeux, CAO, conception de puce.
- Travail de connaissance agentique — recherche approfondie avec visualisations interactives, tableaux de bord, montage vidéo.
- Multimodalité native et contexte long — texte, image, vidéo dans le même modèle et le même contexte.
- Efficacité coût — scores proches de la tête à une fraction du prix.
- Poids ouverts.
L'étude de cas la plus significative
En une seule exécution autonome de 48 heures avec Kimi Code, le modèle a conçu, optimisé et vérifié le prototype d'une puce d'inférence pour un nano-modèle : 1,46 million de cellules standard, 0,277 Mio de SRAM, un réseau MAC INT4 avec déquantification fusionnée, respectant le timing à 100 MHz dans un budget de 4 mm². Le RTL est publié (nano-kpu) — c'est donc une revendication auditable, contrairement à la plupart des études de cas.
Les limites reconnues par Moonshot¶
Le rapport et le billet de blog reconnaissent explicitement :
- un retard sur le raisonnement de niveau recherche : 23,4 % sur CritPt contre 32,3 % pour GPT-5.6 Sol, et un retard sur HLE-Full ;
- un écart d'expérience utilisateur notable face à Claude Fable 5 et GPT-5.6 Sol ;
- une sensibilité à la préservation de l'historique de réflexion — le
modèle se dégrade si on ne lui renvoie pas son
reasoning_content; - une proactivité excessive dans les situations ambiguës ;
- sur la cybersécurité, un écart clair au niveau expert humain : 14 tâches résolues sur 36, dont 10 seulement en espace utilisateur.
Un point de méthode à retenir
Un rapport qui liste ses propres échecs est plus crédible qu'un rapport qui n'en liste aucun — mais cela ne rend pas ses chiffres positifs indépendants pour autant. La partie Évaluations tierces sépare soigneusement les deux.
Chapitre précédent : Moonshot AI et la série Kimi · Chapitre suivant : Fiche technique complète