Affirmations à vérifier¶
Chaque revendication notable du rapport, avec son niveau de preuve.
L'échelle de notation¶
| Niveau | Signification |
|---|---|
| ★★★ | Vérifié — recalculé, testé, ou confirmé par un tiers indépendant |
| ★★☆ | Plausible — cohérent, méthodologie décrite, mais non vérifiable en l'état |
| ★☆☆ | Non vérifiable — affirmation de constructeur sans preuve exploitable |
| ✗ | Contredit par une source ou par l'arithmétique |
Architecture et chiffres¶
| Affirmation | Niveau | Justification |
|---|---|---|
| 2,78 T de paramètres | ★★★ | Reconstruit à 2,779 T depuis config.json — écart 0,04 % |
| 104,2 G activés par jeton | ★★★ | Reconstruit à 104,0 G — écart 0,2 % |
| 93 couches = 69 KDA + 24 MLA | ★★★ | Lisible dans full_attn_layers |
| 896 experts, 16 actifs | ★★★ | num_experts, num_experts_per_token |
| Contexte 1 M | ★★★ | max_position_embeddings: 1048576 |
| \(g_{\min} = -5\) | ★★★ | gate_lower_bound: -5.0 |
| \(\beta_1 = 4\), \(\beta_2 = 25\) | ★★★ | activation_situ_beta, ..._linear_beta |
| SiTU-GLU borné à \(\beta_1\beta_2 = 100\) | ★★★ | Testé : max mesuré = 100,000 sur 200 000 tirages |
| SiTU-GLU ≈ SwiGLU au premier ordre | ★★★ | Testé : écart relatif < 0,53 % près de l'origine |
| Identité de composition KCP | ★★★ | Testé : erreur \(6{,}94\times10^{-18}\) |
| Balayage préfixe KCP exact | ★★★ | Testé : erreur \(1{,}39\times10^{-17}\) sur 4 rangs |
| Théorème MoonEP \(M(I) \le E/R\) | ★★★ | Démontré en annexe D |
| Quasi-optimalité de la borne | ★★★ | Démontré en annexe D |
| Dérivation duale de QB | ★★★ | Démontrée en annexe B |
| Vocabulaire « 160 K » | ✗ | La valeur exacte est 163 840 |
| « 1 couche MTP » | ✗ | num_nextn_predict_layers: 0 dans le dépôt public |
Entraînement¶
| Affirmation | Niveau | Justification |
|---|---|---|
| « ~2,5× d'efficacité d'échelle vs K2 » | ★☆☆ | Figure sans axes chiffrés, jeu de validation non publié, aucune ablation par composant, gain attribué conjointement à l'architecture et aux données |
| « Le cosinus bat WSD » | ★★☆ | Méthodologie exemplaire (recherche de loi d'échelle indépendante par calendrier), mais aucune quantification de l'écart |
| Curriculum 8 K → 64 K → 256 K → 1 M | ★★☆ | Déclaré, cohérent, non vérifiable |
| MoonViT-V2 égale la ligne SigLIP | ★★☆ | Une courbe de normes de gradient publiée, aucun tableau de scores comparatif |
| QAT MXFP4 dès le SFT | ★★★ | Confirmé par quantization_config et la liste ignore |
| 9 experts RL (3 domaines × 3 efforts) | ★★☆ | Déclaré ; cohérent avec l'API (reasoning_effort) |
| Distillation top-\(k\) sans avantage | ★★☆ | Résultat négatif publié, non chiffré |
| Le RL fait croître les étapes d'outils | ★★☆ | Figure 6, sans axes chiffrés |
Le « 2,5× » mérite qu'on s'y arrête
C'est le chiffre repris partout. Cinq raisons de ne pas le traiter comme un fait :
- Attribué collectivement à KDA + AttnRes + LatentMoE + les recettes de données et d'entraînement. Impossible de séparer l'architecture des données.
- Figure sans axes chiffrés (fig. 3).
- Jeu de validation OOD non publié — hors de quelle distribution ?
- La perte n'est pas la capacité : K3 reste derrière Fable 5 et Sol sur plusieurs bancs malgré ce gain.
- Aucun tiers ne peut vérifier : il faudrait le corpus, les hyperparamètres et le jeu de validation.
Plausible, mais non établi, et non attribuable.
Infrastructure¶
| Affirmation | Niveau | Justification |
|---|---|---|
| MoonEP, équilibre parfait | ★★★ | Théorème démontré, code ouvert |
| KCP à communication de taille fixe | ★★★ | Identité vérifiée ; PR référencée dans FLA |
| AgentENV : 133 ms / 49 ms | ★★☆ | Mesure interne, mais code ouvert donc auditable |
| 51 219 741 sandboxes | ★☆☆ | Non vérifiable, sans enjeu comparatif |
| Surengagement mémoire 6,5× | ★☆☆ | Mesure interne |
| Pause = 98 % de la vie d'une sandbox | ★★☆ | Plausible et cohérent avec le régime décrit |
| Cache de préfixe à toute frontière de 512 | ★★☆ | Mécanisme décrit en détail, non testable sans l'implémentation |
| FlashKDA dépasse Triton | ★☆☆ | Non chiffré |
Évaluations¶
| Affirmation | Niveau | Justification |
|---|---|---|
| Artificial Analysis 57,1, #4/580 | ★★★ | Tiers indépendant |
| Vals Index 74,7 %, #2/39 | ★★★ | Tiers indépendant |
| WebDev Arena 1 678, #1/99 | ★★★ | Tiers, vote humain |
| Text Arena #8/200, Agent Arena #4/37 | ★★★ | Tiers, mais Elo instables |
| Kimi Webdev Bench +31,0 / +59,1 | ★★☆ | Interne, mais jugement aveugle par experts, harnais identique — méthodologiquement solide, et corroboré par le WebDev Arena |
| BrowseComp 91,2 % | ★★☆ | Interne ; méthodologie décrite (compaction à 300 K) |
| SWE-Marathon 42,0 (+7 vs Fable 5) | ★★☆ | Branche recalibrée H20 ; Fable 5 en repli sur 35 % des tâches |
| Terminal-Bench 88,3 | ★★☆ | Meilleur score parmi les harnais ; contesté par NxCode |
| Scores de codage en général | ★☆☆ | Harnais mélangés ; non reproduits sous harnais commun |
| Écarts de 0,2 point commentés | ✗ | Très probablement dans le bruit ; ni \(n\) ni intervalle |
| Efficacité coût sur 4 suites | ★★☆ | Sources de coûts hétérogènes (mesuré / cité / grille tarifaire) |
| Contradiction avec AA sur le coût | — | Les deux sont vrais selon le groupe de comparaison |
Cybersécurité¶
| Affirmation | Niveau | Justification |
|---|---|---|
| ~70 % des trouvailles confirmées | ★☆☆ | Interne, dénominateur non donné |
| 16 vulnérabilités inédites sur 6 projets | ★☆☆ | Aucun CVE ni identifiant fourni — invérifiable en pratique |
| Deux bugs noyau Linux détaillés | ★★☆ | Descriptions précises et plausibles, sans référence |
| 14/36 vs 8/36 pour GLM-5.2 | ★★☆ | Interne, mais étalonné en heures-expert (540 h, ~15 h/tâche) |
| Chaque tâche résoluble par un expert | ★★★ | Méthodologie explicitement vérifiée |
| ExploitBench 32 % vs 24 % | ★★★ | UK AISI + NIST CAISI — évaluation gouvernementale |
| 17/32 étapes réseau simulé | ★★★ | Idem |
| 0/41 exécution de code arbitraire | ★★★ | Idem |
Le meilleur exemple de vérification externe du dossier
Sur le domaine le plus sensible, l'auto-évaluation de Moonshot et l'évaluation conjointe UK AISI / NIST CAISI convergent. C'est un indicateur fort de la qualité du processus d'évaluation interne.
Études de cas¶
| Cas | Niveau | Justification |
|---|---|---|
| nano-kpu (puce, 48 h) | ★★★ | RTL publié sur GitHub — auditable |
| MiniTriton (compilateur) | ★★★ | Code publié — auditable |
| Optimisation de noyaux GPU | ★★☆ | Chiffres précis, pas de code ; usage interne déclaré |
| I–Love–Q (astrophysique) | ★☆☆ | Incohérences trouvées non nommées |
| Travail de connaissance | ★☆☆ | Chiffres impressionnants, invérifiables |
| Montage vidéo | ★☆☆ | Invérifiable |
Licence et disponibilité¶
| Affirmation | Niveau | Justification |
|---|---|---|
| Poids publiés | ★★★ | 118 fichiers, 1 560 998 984 390 octets vérifiés par l'API HF |
| Licence permissive sous conditions | ★★★ | Texte de licence lu intégralement |
| « Open » | ✗ | Pas open source au sens de l'OSI ; Moonshot ne le prétend plus |
| Tarifs 0,30 / 3,00 / 15,00 $ | ★★★ | Blog officiel, confirmé par les agrégateurs |
| « ~594 Go de téléchargement » (presse) | ✗ | Faux. 1,56 To vérifié ; incompatible avec l'arithmétique MXFP4 |
Bilan¶
★★★ vérifié ████████████████████████░░░░░░░░░░░░ environ 35 %
★★☆ plausible ████████████████████████████░░░░░░░░ environ 40 %
★☆☆ non vérifiable ██████████████████░░░░░░░░░░░░░░░░░░ environ 20 %
✗ contredit ████░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░ environ 5 %
La conclusion
Tout ce qui touche à l'architecture est vérifiable et vérifié. Tout ce qui touche aux données, au calcul et aux gains d'entraînement ne l'est pas.
C'est exactement la ligne de partage entre ce qui ne coûte rien à publier et ce qui constitue l'avantage compétitif.
Chapitre précédent : Limites et angles morts · Chapitre suivant : Questions ouvertes