Aller au contenu

Affirmations à vérifier

Chaque revendication notable du rapport, avec son niveau de preuve.

L'échelle de notation

Niveau Signification
★★★ Vérifié — recalculé, testé, ou confirmé par un tiers indépendant
★★☆ Plausible — cohérent, méthodologie décrite, mais non vérifiable en l'état
★☆☆ Non vérifiable — affirmation de constructeur sans preuve exploitable
✗ Contredit par une source ou par l'arithmétique

Architecture et chiffres

Affirmation Niveau Justification
2,78 T de paramètres ★★★ Reconstruit à 2,779 T depuis config.json — écart 0,04 %
104,2 G activés par jeton ★★★ Reconstruit à 104,0 G — écart 0,2 %
93 couches = 69 KDA + 24 MLA ★★★ Lisible dans full_attn_layers
896 experts, 16 actifs ★★★ num_experts, num_experts_per_token
Contexte 1 M ★★★ max_position_embeddings: 1048576
\(g_{\min} = -5\) ★★★ gate_lower_bound: -5.0
\(\beta_1 = 4\), \(\beta_2 = 25\) ★★★ activation_situ_beta, ..._linear_beta
SiTU-GLU borné à \(\beta_1\beta_2 = 100\) ★★★ Testé : max mesuré = 100,000 sur 200 000 tirages
SiTU-GLU ≈ SwiGLU au premier ordre ★★★ Testé : écart relatif < 0,53 % près de l'origine
Identité de composition KCP ★★★ Testé : erreur \(6{,}94\times10^{-18}\)
Balayage préfixe KCP exact ★★★ Testé : erreur \(1{,}39\times10^{-17}\) sur 4 rangs
Théorème MoonEP \(M(I) \le E/R\) ★★★ Démontré en annexe D
Quasi-optimalité de la borne ★★★ Démontré en annexe D
Dérivation duale de QB ★★★ Démontrée en annexe B
Vocabulaire « 160 K » ✗ La valeur exacte est 163 840
« 1 couche MTP » ✗ num_nextn_predict_layers: 0 dans le dépôt public

Entraînement

Affirmation Niveau Justification
« ~2,5× d'efficacité d'échelle vs K2 » ★☆☆ Figure sans axes chiffrés, jeu de validation non publié, aucune ablation par composant, gain attribué conjointement à l'architecture et aux données
« Le cosinus bat WSD » ★★☆ Méthodologie exemplaire (recherche de loi d'échelle indépendante par calendrier), mais aucune quantification de l'écart
Curriculum 8 K → 64 K → 256 K → 1 M ★★☆ Déclaré, cohérent, non vérifiable
MoonViT-V2 égale la ligne SigLIP ★★☆ Une courbe de normes de gradient publiée, aucun tableau de scores comparatif
QAT MXFP4 dès le SFT ★★★ Confirmé par quantization_config et la liste ignore
9 experts RL (3 domaines × 3 efforts) ★★☆ Déclaré ; cohérent avec l'API (reasoning_effort)
Distillation top-\(k\) sans avantage ★★☆ Résultat négatif publié, non chiffré
Le RL fait croître les étapes d'outils ★★☆ Figure 6, sans axes chiffrés

Le « 2,5× » mérite qu'on s'y arrête

C'est le chiffre repris partout. Cinq raisons de ne pas le traiter comme un fait :

  1. Attribué collectivement à KDA + AttnRes + LatentMoE + les recettes de données et d'entraînement. Impossible de séparer l'architecture des données.
  2. Figure sans axes chiffrés (fig. 3).
  3. Jeu de validation OOD non publié — hors de quelle distribution ?
  4. La perte n'est pas la capacité : K3 reste derrière Fable 5 et Sol sur plusieurs bancs malgré ce gain.
  5. Aucun tiers ne peut vérifier : il faudrait le corpus, les hyperparamètres et le jeu de validation.

Plausible, mais non établi, et non attribuable.

Infrastructure

Affirmation Niveau Justification
MoonEP, équilibre parfait ★★★ Théorème démontré, code ouvert
KCP à communication de taille fixe ★★★ Identité vérifiée ; PR référencée dans FLA
AgentENV : 133 ms / 49 ms ★★☆ Mesure interne, mais code ouvert donc auditable
51 219 741 sandboxes ★☆☆ Non vérifiable, sans enjeu comparatif
Surengagement mémoire 6,5× ★☆☆ Mesure interne
Pause = 98 % de la vie d'une sandbox ★★☆ Plausible et cohérent avec le régime décrit
Cache de préfixe à toute frontière de 512 ★★☆ Mécanisme décrit en détail, non testable sans l'implémentation
FlashKDA dépasse Triton ★☆☆ Non chiffré

Évaluations

Affirmation Niveau Justification
Artificial Analysis 57,1, #4/580 ★★★ Tiers indépendant
Vals Index 74,7 %, #2/39 ★★★ Tiers indépendant
WebDev Arena 1 678, #1/99 ★★★ Tiers, vote humain
Text Arena #8/200, Agent Arena #4/37 ★★★ Tiers, mais Elo instables
Kimi Webdev Bench +31,0 / +59,1 ★★☆ Interne, mais jugement aveugle par experts, harnais identique — méthodologiquement solide, et corroboré par le WebDev Arena
BrowseComp 91,2 % ★★☆ Interne ; méthodologie décrite (compaction à 300 K)
SWE-Marathon 42,0 (+7 vs Fable 5) ★★☆ Branche recalibrée H20 ; Fable 5 en repli sur 35 % des tâches
Terminal-Bench 88,3 ★★☆ Meilleur score parmi les harnais ; contesté par NxCode
Scores de codage en général ★☆☆ Harnais mélangés ; non reproduits sous harnais commun
Écarts de 0,2 point commentés ✗ Très probablement dans le bruit ; ni \(n\) ni intervalle
Efficacité coût sur 4 suites ★★☆ Sources de coûts hétérogènes (mesuré / cité / grille tarifaire)
Contradiction avec AA sur le coût — Les deux sont vrais selon le groupe de comparaison

Cybersécurité

Affirmation Niveau Justification
~70 % des trouvailles confirmées ★☆☆ Interne, dénominateur non donné
16 vulnérabilités inédites sur 6 projets ★☆☆ Aucun CVE ni identifiant fourni — invérifiable en pratique
Deux bugs noyau Linux détaillés ★★☆ Descriptions précises et plausibles, sans référence
14/36 vs 8/36 pour GLM-5.2 ★★☆ Interne, mais étalonné en heures-expert (540 h, ~15 h/tâche)
Chaque tâche résoluble par un expert ★★★ Méthodologie explicitement vérifiée
ExploitBench 32 % vs 24 % ★★★ UK AISI + NIST CAISI — évaluation gouvernementale
17/32 étapes réseau simulé ★★★ Idem
0/41 exécution de code arbitraire ★★★ Idem

Le meilleur exemple de vérification externe du dossier

Sur le domaine le plus sensible, l'auto-évaluation de Moonshot et l'évaluation conjointe UK AISI / NIST CAISI convergent. C'est un indicateur fort de la qualité du processus d'évaluation interne.

Études de cas

Cas Niveau Justification
nano-kpu (puce, 48 h) ★★★ RTL publié sur GitHub — auditable
MiniTriton (compilateur) ★★★ Code publié — auditable
Optimisation de noyaux GPU ★★☆ Chiffres précis, pas de code ; usage interne déclaré
I–Love–Q (astrophysique) ★☆☆ Incohérences trouvées non nommées
Travail de connaissance ★☆☆ Chiffres impressionnants, invérifiables
Montage vidéo ★☆☆ Invérifiable

Licence et disponibilité

Affirmation Niveau Justification
Poids publiés ★★★ 118 fichiers, 1 560 998 984 390 octets vérifiés par l'API HF
Licence permissive sous conditions ★★★ Texte de licence lu intégralement
« Open » ✗ Pas open source au sens de l'OSI ; Moonshot ne le prétend plus
Tarifs 0,30 / 3,00 / 15,00 $ ★★★ Blog officiel, confirmé par les agrégateurs
« ~594 Go de téléchargement » (presse) ✗ Faux. 1,56 To vérifié ; incompatible avec l'arithmétique MXFP4

Bilan

★★★ vérifié          ████████████████████████░░░░░░░░░░░░  environ 35 %
★★☆ plausible        ████████████████████████████░░░░░░░░  environ 40 %
★☆☆ non vérifiable   ██████████████████░░░░░░░░░░░░░░░░░░  environ 20 %
✗   contredit        ████░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░  environ  5 %

La conclusion

Tout ce qui touche à l'architecture est vérifiable et vérifié. Tout ce qui touche aux données, au calcul et aux gains d'entraînement ne l'est pas.

C'est exactement la ligne de partage entre ce qui ne coûte rien à publier et ce qui constitue l'avantage compétitif.


Chapitre précédent : Limites et angles morts · Chapitre suivant : Questions ouvertes