Aller au contenu

Ce qui est public et ce qui ne l'est pas

Inventaire complet, établi en croisant le rapport technique, le config.json publié, la carte de modèle et les dépôts ouverts.

✅ Entièrement publié et vérifiable

Élément Où
Toutes les dimensions de l'architecture config.json
Composition exacte des couches (indices KDA/MLA) config.json → full_attn_layers
Équation de récurrence KDA Rapport, éq. 1
Paramétrisation KDA (\(q,k,v,\beta,z\)) Rapport, éq. 2
Décroissance bornée et \(g_{\min} = -5\) Rapport, éq. 4 + gate_lower_bound
Porte de sortie KDA et MLA Rapport, éq. 5 et 6
Full et Block AttnRes Rapport, éq. 7–9
Formule LatentMoE Rapport, éq. 10
SiTU-GLU et ses \(\beta\) Rapport, éq. 11 + config
Routage MoE et Quantile Balancing Rapport, éq. 12–13
Dérivation duale complète de QB Rapport, annexe B
Estimateur par histogramme de QB Rapport, annexe C
Théorèmes MoonEP (\(E/R\)) avec preuves Rapport, annexe D
Récompense MOPD Rapport, section 4.1.3
Perte LK du modèle brouillon Rapport, section 4.1.4
Identité de composition KCP Rapport, éq. 14
Format de conversation XTML Rapport, annexe E
Schéma de quantification MXFP4 Rapport + quantization_config
Les poids eux-mêmes Hugging Face, 1,56 To
Code MoonEP GitHub
Code AgentENV GitHub
KDA dans flash-linear-attention PR #691
MiniTriton, nano-kpu GitHub

L'essentiel de l'architecture est là

Avec ces éléments, écrire une implémentation de référence de l'architecture complète est faisable — c'est l'objet des chapitres 03 et 04.

⚠️ Partiellement publié

Élément Ce qui manque
Transformation UT de la forme par blocs KDA Renvoi à Kimi Linear (arXiv 2510.26692) — récupérable, mais pas dans ce papier
Weight clipping Renvoi à Kimi K2, sans formule
Per-Head Muon L'idée est claire ; ni le nombre d'itérations de Newton–Schulz ni les constantes ne sont donnés
MoonViT-V2 Dimensions publiées, mais pas la recette d'entraînement de l'encodeur
FlashKDA Cité comme référence, mais le noyau CUTLASS n'est pas dans le papier
Chat template Structure décrite ; le gabarit exact est dans le dépôt HF (tokenizer_config)

❌ Non publié — les lacunes critiques

Les données

Élément Statut
Nombre total de jetons d'entraînement ❌
Proportions par domaine ❌
Sources précises ❌
Langues et proportions ❌
Date de coupure des connaissances ❌
Politique vis-à-vis du copyright ❌
Seuils des classifieurs de qualité ❌
Détails de la vérification de fidélité ❌

C'est la lacune n° 1

Les données comptent au moins autant que l'architecture. Sans elles, aucune reproduction n'est envisageable — et l'attribution du gain « 2,5× » à l'architecture est invérifiable.

Les hyperparamètres

Élément Statut
Taux d'apprentissage de pointe et minimal ❌
Taille de lot ❌
Ratio TPP ❌
Nombre de pas ❌
Résultats des études de loi d'échelle ❌ (seule la conclusion « cosinus > WSD » est donnée)

L'algorithme de RL

C'est la lacune n° 2

L'algorithme d'optimisation de politique n'est jamais formulé. Le rapport renvoie à Kimi K2.5 et décrit son effet en prose :

a per-token regularization […] By constraining policy updates within a localized neighborhood…

Aucune équation. Or c'est le mécanisme qui rend possible tout le RL long-horizon en régime fortement hors-politique.

Autres manques du RL : la valeur de \(\lambda\) (fraction de complétion du partial rollout), \(N\) et \(K\), \(R_{\max}\) du clip MOPD, les valeurs de \(\tau\) par domaine, la valeur de \(\sigma\) du contrôle de verbosité.

Le budget

Élément Statut
Nombre de GPU ❌
Durée d'entraînement ❌
FLOPs totaux ❌
Coût financier ❌
Coût énergétique / carbone ❌

Les incohérences repérées

Trois points où le rapport et les artefacts publiés divergent. Chacun mérite d'être vérifié avant toute réimplémentation.

1. La couche MTP

Le rapport annonce 1 couche MTP (comme Kimi K2), et décrit son affinage en modèle brouillon EAGLE-3.

Le config.json publié porte "num_nextn_predict_layers": 0.

Conclusion probable : le MTP et le brouillon ne sont pas dans le dépôt de poids public. Le décodage spéculatif décrit n'est donc pas reproductible à partir des seuls poids publiés.

2. qk_rope_head_dim avec NoPE

mla_use_nope: true et qk_rope_head_dim: 64. La dimension est allouée dans les projections, mais la rotation n'est pas appliquée.

Vraisemblablement un héritage structurel du code MLA de DeepSeek. Si vous supprimez ces 64 dimensions, votre décompte de paramètres divergera du dépôt officiel.

3. Taille du vocabulaire

Le rapport dit « 160 K ». Le config.json dit 163840. Simple arrondi de communication, mais utilisez la valeur exacte pour dimensionner lm_head.

Un point où la reconstruction lève une ambiguïté

La taille des experts partagés

Le rapport ne dit pas quelle dimension intermédiaire ont les 2 experts partagés. Deux lectures étaient possibles :

  • intermediate_size: 33792 (la valeur du FFN dense) → total > 2,80 T ❌
  • \(2 \times\) moe_intermediate_size \(= 6144\) → total 2,779 T ✅

Seule la seconde reconstitue les 2,78 T et les 104,2 G annoncés. La contrainte de cohérence des totaux tranche l'ambiguïté du texte. Voir Retrouver les paramètres.

Synthèse

                 ARCHITECTURE          ██████████████████░░  90 % publié
                 INFRASTRUCTURE        ████████████░░░░░░░░  60 % publié
                 POST-ENTRAÎNEMENT     ████████░░░░░░░░░░░░  40 % publié
                 HYPERPARAMÈTRES       ██░░░░░░░░░░░░░░░░░░  10 % publié
                 DONNÉES               █░░░░░░░░░░░░░░░░░░░   5 % publié
                 BUDGET DE CALCUL      ░░░░░░░░░░░░░░░░░░░░   0 % publié

Une comparaison utile

Ce profil est typique des rapports de 2026, y compris chez les acteurs ouverts. Il tranche avec l'ère 2020–2022 (GPT-3, Chinchilla, PaLM), où les budgets de calcul et les compositions de corpus étaient publiés.

Kimi K3 est plus ouvert que la moyenne sur l'architecture et l'infrastructure — les preuves en annexe et les dépôts de code sont inhabituels — et dans la norme sur le silence des données.


Chapitre suivant : Retrouver les 2,8 T de paramètres