Ce qui est public et ce qui ne l'est pas¶
Inventaire complet, établi en croisant le rapport technique, le config.json
publié, la carte de modèle et les dépôts ouverts.
✅ Entièrement publié et vérifiable¶
| Élément | Où |
|---|---|
| Toutes les dimensions de l'architecture | config.json |
| Composition exacte des couches (indices KDA/MLA) | config.json → full_attn_layers |
| Équation de récurrence KDA | Rapport, éq. 1 |
| Paramétrisation KDA (\(q,k,v,\beta,z\)) | Rapport, éq. 2 |
| Décroissance bornée et \(g_{\min} = -5\) | Rapport, éq. 4 + gate_lower_bound |
| Porte de sortie KDA et MLA | Rapport, éq. 5 et 6 |
| Full et Block AttnRes | Rapport, éq. 7–9 |
| Formule LatentMoE | Rapport, éq. 10 |
| SiTU-GLU et ses \(\beta\) | Rapport, éq. 11 + config |
| Routage MoE et Quantile Balancing | Rapport, éq. 12–13 |
| Dérivation duale complète de QB | Rapport, annexe B |
| Estimateur par histogramme de QB | Rapport, annexe C |
| Théorèmes MoonEP (\(E/R\)) avec preuves | Rapport, annexe D |
| Récompense MOPD | Rapport, section 4.1.3 |
| Perte LK du modèle brouillon | Rapport, section 4.1.4 |
| Identité de composition KCP | Rapport, éq. 14 |
| Format de conversation XTML | Rapport, annexe E |
| Schéma de quantification MXFP4 | Rapport + quantization_config |
| Les poids eux-mêmes | Hugging Face, 1,56 To |
| Code MoonEP | GitHub |
| Code AgentENV | GitHub |
| KDA dans flash-linear-attention | PR #691 |
| MiniTriton, nano-kpu | GitHub |
L'essentiel de l'architecture est là
Avec ces éléments, écrire une implémentation de référence de l'architecture complète est faisable — c'est l'objet des chapitres 03 et 04.
⚠️ Partiellement publié¶
| Élément | Ce qui manque |
|---|---|
| Transformation UT de la forme par blocs KDA | Renvoi à Kimi Linear (arXiv 2510.26692) — récupérable, mais pas dans ce papier |
| Weight clipping | Renvoi à Kimi K2, sans formule |
| Per-Head Muon | L'idée est claire ; ni le nombre d'itérations de Newton–Schulz ni les constantes ne sont donnés |
| MoonViT-V2 | Dimensions publiées, mais pas la recette d'entraînement de l'encodeur |
| FlashKDA | Cité comme référence, mais le noyau CUTLASS n'est pas dans le papier |
| Chat template | Structure décrite ; le gabarit exact est dans le dépôt HF (tokenizer_config) |
❌ Non publié — les lacunes critiques¶
Les données¶
| Élément | Statut |
|---|---|
| Nombre total de jetons d'entraînement | ❌ |
| Proportions par domaine | ❌ |
| Sources précises | ❌ |
| Langues et proportions | ❌ |
| Date de coupure des connaissances | ❌ |
| Politique vis-à-vis du copyright | ❌ |
| Seuils des classifieurs de qualité | ❌ |
| Détails de la vérification de fidélité | ❌ |
C'est la lacune n° 1
Les données comptent au moins autant que l'architecture. Sans elles, aucune reproduction n'est envisageable — et l'attribution du gain « 2,5× » à l'architecture est invérifiable.
Les hyperparamètres¶
| Élément | Statut |
|---|---|
| Taux d'apprentissage de pointe et minimal | ❌ |
| Taille de lot | ❌ |
| Ratio TPP | ❌ |
| Nombre de pas | ❌ |
| Résultats des études de loi d'échelle | ❌ (seule la conclusion « cosinus > WSD » est donnée) |
L'algorithme de RL¶
C'est la lacune n° 2
L'algorithme d'optimisation de politique n'est jamais formulé. Le rapport renvoie à Kimi K2.5 et décrit son effet en prose :
a per-token regularization […] By constraining policy updates within a localized neighborhood…
Aucune équation. Or c'est le mécanisme qui rend possible tout le RL long-horizon en régime fortement hors-politique.
Autres manques du RL : la valeur de \(\lambda\) (fraction de complétion du partial rollout), \(N\) et \(K\), \(R_{\max}\) du clip MOPD, les valeurs de \(\tau\) par domaine, la valeur de \(\sigma\) du contrôle de verbosité.
Le budget¶
| Élément | Statut |
|---|---|
| Nombre de GPU | ❌ |
| Durée d'entraînement | ❌ |
| FLOPs totaux | ❌ |
| Coût financier | ❌ |
| Coût énergétique / carbone | ❌ |
Les incohérences repérées¶
Trois points où le rapport et les artefacts publiés divergent. Chacun mérite d'être vérifié avant toute réimplémentation.
1. La couche MTP
Le rapport annonce 1 couche MTP (comme Kimi K2), et décrit son affinage en modèle brouillon EAGLE-3.
Le config.json publié porte "num_nextn_predict_layers": 0.
Conclusion probable : le MTP et le brouillon ne sont pas dans le dépôt de poids public. Le décodage spéculatif décrit n'est donc pas reproductible à partir des seuls poids publiés.
2. qk_rope_head_dim avec NoPE
mla_use_nope: true et qk_rope_head_dim: 64. La dimension est allouée
dans les projections, mais la rotation n'est pas appliquée.
Vraisemblablement un héritage structurel du code MLA de DeepSeek. Si vous supprimez ces 64 dimensions, votre décompte de paramètres divergera du dépôt officiel.
3. Taille du vocabulaire
Le rapport dit « 160 K ». Le config.json dit 163840. Simple arrondi de
communication, mais utilisez la valeur exacte pour dimensionner lm_head.
Un point où la reconstruction lève une ambiguïté¶
La taille des experts partagés
Le rapport ne dit pas quelle dimension intermédiaire ont les 2 experts partagés. Deux lectures étaient possibles :
intermediate_size: 33792(la valeur du FFN dense) → total > 2,80 T ❌- \(2 \times\)
moe_intermediate_size\(= 6144\) → total 2,779 T ✅
Seule la seconde reconstitue les 2,78 T et les 104,2 G annoncés. La contrainte de cohérence des totaux tranche l'ambiguïté du texte. Voir Retrouver les paramètres.
Synthèse¶
ARCHITECTURE ██████████████████░░ 90 % publié
INFRASTRUCTURE ████████████░░░░░░░░ 60 % publié
POST-ENTRAÎNEMENT ████████░░░░░░░░░░░░ 40 % publié
HYPERPARAMÈTRES ██░░░░░░░░░░░░░░░░░░ 10 % publié
DONNÉES █░░░░░░░░░░░░░░░░░░░ 5 % publié
BUDGET DE CALCUL ░░░░░░░░░░░░░░░░░░░░ 0 % publié
Une comparaison utile
Ce profil est typique des rapports de 2026, y compris chez les acteurs ouverts. Il tranche avec l'ère 2020–2022 (GPT-3, Chinchilla, PaLM), où les budgets de calcul et les compositions de corpus étaient publiés.
Kimi K3 est plus ouvert que la moyenne sur l'architecture et l'infrastructure — les preuves en annexe et les dépôts de code sont inhabituels — et dans la norme sur le silence des données.
Chapitre suivant : Retrouver les 2,8 T de paramètres