Forces¶
1. La cohérence architecturale¶
Ce n'est pas une collection d'astuces. Les composants se justifient mutuellement, et le rapport le montre.
KDA (attention linéaire)
├─► permet 1 M de contexte à coût acceptable
├─► porte implicitement la position
│ └─► permet NoPE sur MLA
│ └─► permet d'étendre le contexte SANS modifier le modèle
├─► exige la décroissance bornée (g_min = -5)
│ └─► ce qui débloque les Tensor Cores sur TOUTES les tuiles
└─► exige KCP, FlashKDA, le cache de préfixe hybride
LatentMoE (896 experts, ℓ = 0,5 d)
├─► divise par 2 le trafic de communication
├─► exige SiTU-GLU (activations bornées)
├─► exige une RMSNorm avant W↑
└─► exige Quantile Balancing (896 experts)
AttnRes
├─► brise le goulot du résidu additif
├─► coûte 0,00002 % de paramètres
├─► est rendu mémoire-neutre par le checkpointing intégral
└─► fournit les caractéristiques multi-niveaux du modèle brouillon
Le fil rouge : la stabilité
Cinq mécanismes indépendants convergent vers le même objectif :
| Mécanisme | Ce qu'il borne |
|---|---|
| Décroissance \(g_{\min} = -5\) | La plage numérique de KDA |
| SiTU-GLU | Les activations des FFN, à \(\pm 100\) |
| RMSNorm du LatentMoE | L'échelle de la branche routée |
| MoonViT depuis zéro | Les normes de gradient de la voie visuelle |
| Per-Head Muon | L'écart d'échelle entre têtes |
À 2,8 T de paramètres, une divergence coûte des semaines de calcul. Investir massivement dans des garanties structurelles plutôt que dans des correctifs a posteriori est le bon arbitrage — et il est visible partout.
2. La rigueur mathématique là où elle existe¶
Trois passages sortent du niveau habituel des rapports de modèles.
Le théorème MoonEP
Une borne supérieure démontrée (\(M(I) \le E/R\) experts redondants) et sa quasi-optimalité (\(\lceil E(R-1)/R^2 \rceil \approx E/R\)).
L'intérêt pratique est direct : réserver \(E/R\) emplacements garantit qu'un plan réalisable existe toujours, donc que l'entraînement ne s'interrompt jamais. Le rapport oppose explicitement cela aux travaux antérieurs (ECHO, UltraEP) qui présélectionnent un nombre d'experts ou imposent un plafond — et doivent s'arrêter quand aucun plan ne rentre dedans.
Un paramètre à régler devient une garantie prouvée.
La dérivation duale de Quantile Balancing
Le résultat le plus éclairant du rapport : le (sous-)gradient du dual par rapport à \(\beta_j\) vaut exactement charge cible moins charge observée, et un pas de SignSGD sur cet objectif redonne la règle de mise à jour par signe de DeepSeek-V3.
Autrement dit, la méthode antérieure était déjà une descente sur le bon objectif — mais une descente qui ne retenait que la direction de l'erreur. QB saute au minimiseur exact.
Cela explique d'un coup pourquoi QB n'a aucun hyperparamètre et pourquoi il équilibre en quelques pas.
L'identité de composition de KCP
Nous l'avons vérifiée numériquement : erreur de \(6{,}94\times10^{-18}\), soit la précision machine. Le parallélisme de contexte de KDA est exact, pas approché.
Voir Implémenter KDA.
3. La co-conception algorithme–système¶
C'est ce qui distingue le plus Kimi K3 des rapports comparables. Cinq exemples où une contrainte matérielle a modifié une équation :
| Contrainte | Modification de l'algorithme |
|---|---|
| Les Tensor Cores refusent le calcul paire-de-positions | Borner la décroissance à \(g_{\min} = -5\), pour que toutes les tuiles soient denses |
| La plage dynamique de BF16 | \(16 \times 5 = 80\), et \(e^{80}\) tient — le choix de \(-5\) est dicté par le format numérique |
| Le débordement en basse précision | SiTU-GLU borne les activations à \(\pm 100\) |
| La sortie FP32 double l'empreinte SMEM | Redessiner le noyau pour la superposer aux tampons KV au lieu du tuile de requête |
| Les états KDA sont trop gros pour un cache fin | Découpler la granularité de hachage de celle de l'allocation |
Pourquoi c'est rare
La plupart des rapports présentent l'algorithme, puis l'implémentation. Kimi K3 montre des cas où l'implémentation a rétroagi sur l'algorithme. C'est la marque d'une équipe où les deux compétences cohabitent réellement.
4. L'ingénierie des environnements RL¶
Probablement l'endroit où se joue la différenciation réelle du modèle.
| Élément | Ce qui est remarquable |
|---|---|
| Environnement en boîte blanche | Le harnais est décomposé en modules recomposables ; l'entraînement expose le modèle à des combinaisons variées, pas à une convention unique |
| Graphe de connaissances auto-évolutif | Déduplication avant insertion, orientation canonique des arêtes, arrêt sur atomicité — trois détails qui empêchent l'explosion combinatoire |
| AET | Récompense ancrée dans l'état final vérifié, jamais dans l'auto-déclaration de l'agent |
| Vérificateurs doubles | Un public (diagnostique, pour apprendre) et un caché (scénarios non vus, pour ne pas surapprendre le vérificateur) |
| Détection de triche | CUDA graph replay, cache d'entrées, réduction de précision — nommés et pénalisés, système « continuellement étendu » |
La transparence sur le reward hacking
Peu de rapports nomment les stratégies de triche que leur modèle a effectivement découvertes. Celui-ci le fait, et décrit les contre-mesures. C'est utile pour la communauté, et c'est un signal de sérieux.
5. Les chiffres qui donnent l'échelle¶
Trois nombres qui résument l'époque
- 51 219 741 sandboxes créées, à partir de 1 505 678 images distinctes.
- 98 % des utilisations de sandbox seraient du temps d'attente sans le mécanisme de pause — d'où son importance.
- 133 ms / 49 ms de latence de checkpoint / reprise.
Ces chiffres disent quelque chose que les benchmarks ne disent pas : l'entraînement d'un modèle agentique de frontière est devenu moins un calcul qu'une exploitation industrielle d'environnements simulés.
6. L'honnêteté partielle¶
Le rapport fait plusieurs choses qu'un document purement promotionnel ne ferait pas.
| Ce qu'il déclare | Effet |
|---|---|
| « Notre performance globale reste derrière Claude Fable 5 et GPT-5.6 Sol » | Dans le résumé du papier |
| « Le raisonnement de niveau recherche reste une direction d'amélioration clé » | Reconnaît un échec |
| SWE-Marathon et PostTrainBench évalués sur H20 au lieu de H100 | Déclare une condition défavorable à la comparabilité |
| Claude Fable 5 atteint des replis sur 35 % des tâches SWE-Marathon | Relativise sa propre victoire |
| « Nous considérons notre évaluation comme une borne inférieure » (cyber) | La bonne formulation en sécurité |
| « Nous avons aussi essayé la distillation top-\(k\), sans avantage clair » | Publie un résultat négatif |
| Les refus des concurrents comptés et annotés | Explique une partie des écarts |
Honnêteté partielle, pas totale
Ces déclarations coexistent avec le silence complet sur les données, les hyperparamètres et le budget de calcul, et avec une affirmation phare — le « 2,5× » — invérifiable et non décomposée.
Le rapport est transparent sur ce qui ne coûte rien et opaque sur ce qui constitue l'avantage compétitif. C'est rationnel, et c'est la norme du secteur. Ce n'est pas de la science ouverte.
7. Le développement web¶
Le résultat le plus solide de tout le dossier
Trois mesures indépendantes convergent :
| Mesure | Résultat |
|---|---|
| Kimi Webdev Bench (interne, jugement aveugle par experts) | +31,0 points globalement, +59,1 sur 3D/WebGL/Shader vs Claude Opus 4.8 |
| WebDev Arena (LMArena, vote humain) | #1 sur 99 modèles, 1 678 Elo, premier modèle ouvert à occuper cette place |
Et la cause est identifiable : le corpus de données multimodales programmatiques (code couplé à son rendu) plus le RL sur des tâches web à récompense mixte avec jugement multimodal.
Quand une mesure interne, une mesure tierce et une explication causale convergent, on peut parler de résultat établi. C'est le seul endroit du dossier où c'est le cas.
Chapitre suivant : Limites et angles morts