Aller au contenu

Questions ouvertes

Des questions que le rapport ne tranche pas, et que personne — y compris Moonshot — ne semble savoir trancher. Elles constituent, prises ensemble, un programme de recherche.

Sur l'architecture

1. Quelle est la contribution réelle de chaque innovation ?

C'est la question sans réponse du rapport. Six innovations architecturales, zéro ablation quantifiée.

On aimerait savoir :

Innovation Contribution au « 2,5× » ?
Décroissance bornée de KDA ? (vraisemblablement surtout de la vitesse)
Porte de rang plein ?
AttnRes ?
SiTU-GLU ? (vraisemblablement surtout de la stabilité)
RMSNorm du LatentMoE ?
Per-Head Muon ?
Les données ?

Sans cette décomposition, un praticien ne peut pas savoir quoi reprendre. C'est la lacune la plus handicapante pour la communauté.

2. Le ratio 3:1 est-il optimal ?

Hérité de Kimi Linear, jamais retesté pour K3. Or K3 change AttnRes, le MoE et l'activation — rien ne garantit que l'optimum n'ait pas bougé.

Questions dérivées : le ratio devrait-il varier selon la profondeur ? Les couches basses ont-elles besoin d'autant d'attention globale que les couches hautes ?

3. Pourquoi la pseudo-requête d'AttnRes est-elle apprise et non calculée ?

\(\mathbf{q}_l = \mathbf{w}_l\) est un paramètre fixe. Une vraie requête \(\mathbf{W}_q\mathbf{h}\) laisserait chaque jeton choisir ses profondeurs.

Le rapport ne discute pas ce choix. Deux raisons plausibles : le coût, et la stabilité d'un routage en profondeur dépendant du jeton.

C'est probablement la piste d'amélioration la plus évidente de l'architecture — et elle est ouverte.

4. Y a-t-il un plancher à la largeur latente \(\ell\) ?

\(\ell = 0{,}5\,d\) chez K3, sans justification. À quel point peut-on descendre avant que les experts routés perdent leur capacité ? La réponse dépend-elle du nombre d'experts partagés qui compensent ?

5. Peut-on remplacer les 24 couches MLA par autre chose ?

Le rôle des couches MLA est le rappel global exact. D'autres mécanismes pourraient le fournir à moindre coût — attention éparse, récupération explicite, mémoire externe. Le rapport ne l'explore pas.

Sur l'entraînement

6. Combien coûte l'unification par MOPD ?

Neuf experts fusionnés, aucune comparaison publiée entre le modèle unifié et les experts individuels.

On ne sait donc pas : combien de points le modèle unifié perd sur le terrain de chaque expert ; s'il y a interférence entre domaines ; si les trois niveaux d'effort sont fidèlement reproduits.

Question de fond : la spécialisation par RL puis la refusion est-elle un bon schéma, ou un contournement d'une difficulté qu'on ne sait pas résoudre directement ?

7. Quel est le coût réel du raisonnement selon l'effort ?

Toutes les évaluations publiées sont à effort max, sauf une mention pour Kimi Code Bench. Aucune courbe score × effort n'est publiée.

C'est pourtant l'information la plus utile en pratique : à quel point high est-il moins bon que max ? Sur quelles tâches low suffit-il ?

8. La reformulation des données a-t-elle une limite ?

Réécrire un fait de dix manières aide. De cent ? De mille ? À partir de quand ajoute-t-on du bruit plutôt que de l'information ? Et quel est le taux d'hallucination introduit par le modèle reformulateur, malgré la vérification de fidélité ?

9. Quel est le rendement décroissant des environnements RL ?

51 millions de sandboxes. Les 10 derniers millions ont-ils apporté autant que les 10 premiers ? Aucune courbe rendement/investissement n'est publiée.

C'est une question à des dizaines de millions de dollars, et probablement l'un des secrets les mieux gardés du secteur.

Sur les capacités

10. Pourquoi la compaction de contexte améliore-t-elle le score ?

Sur BrowseComp : 91,2 % avec compaction à 300 K, 90,4 % sans aucune gestion de contexte sur 1 M.

C'est contre-intuitif — on s'attendrait à ce qu'une opération avec perte dégrade. Le rapport ne l'explique pas.

Hypothèse : un contexte résumé est moins bruité qu'un contexte brut de 900 K jetons, et l'attention y est mieux concentrée. Si c'est vrai, cela interroge la valeur marginale du contexte de 1 M lui-même.

11. À quoi sert vraiment le contexte de 1 M ?

Question dérivée de la précédente. Aucune courbe performance × longueur de contexte n'est publiée. Aucun test systématique de type « aiguille dans une botte de foin » à 1 M.

Si la compaction fonctionne aussi bien, le contexte de 1 M est-il une capacité ou un argument marketing ? Le rapport ne donne pas les éléments pour trancher.

12. Le déficit de « qualité de processus » est-il corrigeable ?

Kimi K3 arrive au bon résultat par un chemin moins propre — Agent Behavior Bench 65,0 contre 76,4, boucles de débogage improductives en cyber, proactivité excessive.

Est-ce un déficit de données (pas assez d'exemples de bon processus), d'objectif (le RL récompense le résultat, pas le chemin), ou de capacité ?

Si c'est l'objectif, la solution serait de récompenser explicitement la discipline — ce qui est exactement ce que mesure l'Agent Behavior Bench. La boucle semble à portée, et pourtant l'écart persiste.

13. Pourquoi le raisonnement de recherche résiste-t-il ?

CritPt 23,4 contre 32,3 ; HLE-Full en retrait avec et sans outils.

Hypothèse : le levier de K3 est l'exécution vérifiable, et le raisonnement de recherche est précisément ce qui ne se vérifie pas automatiquement. Mais alors, comment les modèles propriétaires font-ils mieux ? Ont-ils des données ou des signaux que Moonshot n'a pas ?

Sur les systèmes

14. Le cache de préfixe hybride est-il vraiment sans compromis ?

Le rapport affirme atteindre « la même généralité que pour les modèles à attention complète ». Mais les checkpoints KDA restent épars, et conservés surtout aux frontières de tour.

Que se passe-t-il pour une charge dont les préfixes partagés ne s'alignent pas sur les tours de conversation ? Le taux de succès réel n'est pas publié.

15. Quel est le vrai gain de MoonEP ?

Le théorème est élégant, mais aucun chiffre de débit n'est donné. De combien MoonEP accélère-t-il l'entraînement par rapport à DeepEP ? Le coût mémoire des \(E/R\) experts redondants — jusqu'au doublement de l'empreinte des experts — vaut-il ce gain ?

16. La couche MTP est-elle vraiment absente des poids publics ?

num_nextn_predict_layers: 0 contredit le rapport. Si confirmé, cela signifie que les utilisateurs auto-hébergeant K3 n'ont pas accès au décodage spéculatif décrit — un écart de performance significatif entre l'API de Moonshot et l'auto-hébergement.

Sur l'écosystème

17. Le modèle ouvert peut-il rattraper l'écart ?

Kimi K3 est à 2,8 points de Claude Fable 5 sur l'indice Artificial Analysis, à 0,4 point sur l'indice Vals, et devant au WebDev Arena.

L'écart est-il en train de se réduire, ou Kimi K3 est-il un pic isolé rendu possible par un investissement exceptionnel ? La thèse du rapport — qu'il fallait pousser les deux axes de mise à l'échelle — sera testée par la génération suivante.

18. Que devient l'évaluation quand les modèles conçoivent leurs propres bancs ?

Les environnements RL de Moonshot définissent ce que le modèle apprend à faire, et donc, implicitement, ce sur quoi il excellera. Les bancs qui ressemblent le plus à ces environnements sont ceux où K3 domine ; ceux qui en diffèrent (MIRA Bench, OSWorld 2.0) sont ceux où il est en retrait.

Ce n'est pas de la triche, mais c'est un biais de couverture que les protocoles d'évaluation actuels ne savent pas mesurer.

Ce que ces questions ont en commun

Un motif

Presque toutes se ramènent à la même absence : on ne sait pas décomposer la contribution des ingrédients.

Architecture contre données. Pré-entraînement contre post-entraînement. Contexte long contre compaction. Expert individuel contre modèle unifié. Effort max contre high.

À chaque fois, le rapport donne le résultat global et tait la décomposition. C'est compréhensible commercialement, et c'est ce qui empêche le rapport d'être un travail scientifique au sens plein.


Chapitre précédent : Affirmations à vérifier

Fin de la partie Analyse critique. Suite : Annexes.