Aller au contenu

Ce que Kimi K3 annonce

Ce chapitre liste les revendications du rapport et qualifie chacune : est-ce un fait vérifiable, une mesure interne, ou une interprétation ?

C'est une exigence méthodologique : un rapport technique publié par le constructeur d'un modèle n'est pas une évaluation indépendante.

Les quatre contributions revendiquées

Le rapport les énonce explicitement en introduction.

1. « Pré-entraînement à la frontière ouverte »

Un modèle MoE multimodal natif de 2,8 T de paramètres, 104 B activés, fenêtre de 1 M de jetons. KDA, AttnRes, Stable LatentMoE et les recettes raffinées améliorent collectivement l'efficacité d'échelle d'environ 2,5× par rapport à Kimi K2.

Élément Statut
2,8 T / 104 B / 1 M Fait vérifiable. Reconstruit à 0,2 % près depuis le config.json publié — voir Retrouver les paramètres
Multimodal natif Fait vérifiable. Confirmé par la configuration (KimiK3ForConditionalGeneration, vision_config)
« 2,5× d'efficacité d'échelle » Mesure interne non reproductible. Figure sans axes chiffrés, jeu de validation OOD non publié, aucune ablation par composant

2. « RL pour le passage à l'échelle multi-effort »

RL sur les domaines généraux, agentiques et de code, à plusieurs niveaux d'effort, puis consolidation en un modèle unifié.

Élément Statut
9 experts (3 domaines × 3 efforts) Fait déclaré, cohérent avec l'API (reasoning_effort: low/high/max)
MOPD comme méthode de fusion Fait déclaré, formule de récompense publiée
L'algorithme de RL lui-même Non publié. Le rapport renvoie à Kimi K2.5 et mentionne « une régularisation par jeton » sans la formuler

3. « Infrastructure pour l'intelligence multi-billions / million-jetons »

Co-conception KDA, MoonEP, système RL colocalisé avec sandboxes reprenables, et d'autres innovations.

Élément Statut
MoonEP, borne \(E/R\) d'experts redondants Fait vérifiable. Théorème démontré en annexe, code annoncé ouvert
AgentENV, latences 133 ms / 49 ms Mesure interne, mais le code est ouvert et donc auditable
51 219 741 sandboxes Mesure interne invérifiable, mais sans enjeu de comparaison
KCP, cache de préfixe hybride Fait vérifiable partiellement : une PR est référencée dans flash-linear-attention, la contribution vLLM est annoncée

4. « Un modèle de frontière ouvert »

Élément Statut
Poids publiés Fait vérifiable. 1,56 To sur Hugging Face, 118 fichiers
« Ouvert » Contestable. La licence n'est pas une licence open source au sens de l'OSI — voir Licence

Le tableau des chiffres les plus cités

Affirmation Source Fiabilité
2,8 T paramètres, 104 B actifs Rapport + config publiée ★★★ Vérifié
Contexte 1 M Rapport + config (1048576) ★★★ Vérifié
2,5× d'efficacité d'échelle vs K2 Rapport, fig. 3 ★☆☆ Non reproductible
93 couches = 69 KDA + 24 MLA Rapport + config (full_attn_layers) ★★★ Vérifié
896 experts, 16 actifs Rapport + config ★★★ Vérifié
BrowseComp 91,2 % Évaluation interne Moonshot ★★☆ Interne, méthodologie décrite
Intelligence Index v4.1 = 57,1 (#4/580) Artificial Analysis ★★★ Tiers indépendant
WebDev Arena #1/99 (1 678 Elo) LMArena ★★★ Tiers, préférence humaine
Vals Index 74,7 % (#2/39) Vals AI ★★★ Tiers indépendant
16 vulnérabilités inédites trouvées Évaluation interne ★☆☆ Interne, non détaillée
Coût : moitié de GPT-5.6 Sol sur BrowseComp Mesure interne + prix publiés ★★☆ Mélange de sources

Les capacités mises en avant

Au-delà des chiffres, le rapport insiste sur cinq comportements :

  1. Codage long-horizon — sessions d'ingénierie prolongées avec supervision humaine minimale : optimisation de noyaux GPU, développement de compilateur, jeux, CAO, conception de puce.
  2. Travail de connaissance agentique — recherche approfondie avec visualisations interactives, tableaux de bord, montage vidéo.
  3. Multimodalité native et contexte long — texte, image, vidéo dans le même modèle et le même contexte.
  4. Efficacité coût — scores proches de la tête à une fraction du prix.
  5. Poids ouverts.

L'étude de cas la plus significative

En une seule exécution autonome de 48 heures avec Kimi Code, le modèle a conçu, optimisé et vérifié le prototype d'une puce d'inférence pour un nano-modèle : 1,46 million de cellules standard, 0,277 Mio de SRAM, un réseau MAC INT4 avec déquantification fusionnée, respectant le timing à 100 MHz dans un budget de 4 mm². Le RTL est publié (nano-kpu) — c'est donc une revendication auditable, contrairement à la plupart des études de cas.

Les limites reconnues par Moonshot

Le rapport et le billet de blog reconnaissent explicitement :

  • un retard sur le raisonnement de niveau recherche : 23,4 % sur CritPt contre 32,3 % pour GPT-5.6 Sol, et un retard sur HLE-Full ;
  • un écart d'expérience utilisateur notable face à Claude Fable 5 et GPT-5.6 Sol ;
  • une sensibilité à la préservation de l'historique de réflexion — le modèle se dégrade si on ne lui renvoie pas son reasoning_content ;
  • une proactivité excessive dans les situations ambiguës ;
  • sur la cybersécurité, un écart clair au niveau expert humain : 14 tâches résolues sur 36, dont 10 seulement en espace utilisateur.

Un point de méthode à retenir

Un rapport qui liste ses propres échecs est plus crédible qu'un rapport qui n'en liste aucun — mais cela ne rend pas ses chiffres positifs indépendants pour autant. La partie Évaluations tierces sépare soigneusement les deux.


Chapitre précédent : Moonshot AI et la série Kimi · Chapitre suivant : Fiche technique complète