Aller au contenu

Limites et angles morts

Deux catégories distinctes : ce que le modèle ne fait pas bien, et ce que le rapport ne dit pas.

Partie A — les limites du modèle

1. Le raisonnement de niveau recherche

Banc Kimi K3 Meilleur Écart
CritPt (physique recherche) 23,4 32,3 (Sol) −8,9
HLE-Full sans outils 43,5 53,3 (Fable 5) −9,8
HLE-Full avec outils 56,0 63,0 (Fable 5) −7,0

C'est le déficit le plus large et le plus constant du modèle. Le rapport le reconnaît : research-level reasoning remains a key direction for improvement.

Une hypothèse d'explication

Le post-entraînement de K3 est massivement orienté vers l'exécution vérifiable : un noyau est-il correct et rapide, un site se construit-il, le vérificateur valide-t-il l'état final.

Le raisonnement de recherche est précisément ce qui n'est pas vérifiable automatiquement. Le levier qui fait la force de K3 sur l'agentique ne s'applique pas ici.

C'est une conjecture, pas une conclusion du rapport.

2. La qualité du processus, pas du résultat

C'est la faiblesse la plus structurelle, parce qu'elle se manifeste de façon cohérente sur des domaines sans rapport entre eux.

Domaine Symptôme
Agent Behavior Bench 65,0 contre 76,4 pour Sol — 11,4 points, le plus gros écart des bancs internes. Ce banc note « le comportement d'usage d'outils, l'efficacité et la discipline en plus de la complétion »
Cybersécurité Les quatre modes d'échec sont tous des défauts de jugement stratégique : ne pas compléter une chaîne depuis des primitives obtenues, persister dans une mauvaise stratégie, boucles de débogage improductives, vérification insuffisante avant soumission
Limitations reconnues « proactivité excessive dans les situations ambiguës »
Analyse tierce Kili Technology mesure 36 % d'échec sur des scénarios à invariants cachés, contre 8 % pour Claude Opus 4.8 (chiffre non reproductible, à prendre avec réserve)

Le diagnostic convergent

Kimi K3 arrive souvent au bon résultat, mais par un chemin moins propre. Il explore trop, s'arrête mal, vérifie insuffisamment.

Ce n'est pas un déficit de connaissance ou de capacité technique. C'est un déficit de métacognition : savoir quand changer d'approche, quand s'arrêter, quand douter.

C'est cohérent avec l'aveu de Moonshot d'un « écart notable d'expérience utilisateur » face à Fable 5 et Sol.

3. La généralisation cross-harnais

MIRA Bench utilise un harnais interne explicitement hors distribution. Kimi K3 y obtient 64,1 contre 72,9 pour Claude Fable 5.

Ce que cela signifie

L'environnement RL en boîte blanche a été conçu précisément pour éviter le surapprentissage à un harnais. Il instancie Kimi Code, Claude Code, Codex, OpenClaw, Hermes et des harnais nouveaux, recombinés dynamiquement.

Et malgré cela, l'écart hors distribution reste de 8,8 points. La généralisation cross-harnais est améliorée, pas résolue.

4. L'usage d'ordinateur difficile

Banc Kimi K3 Meilleur Écart
OSWorld-Verified 84,8 85,0 −0,2 (bruit)
OSWorld 2.0 58,3 66,1 −7,8
SaaS-Bench 60,1 61,4 −1,3

La quasi-égalité sur OSWorld-Verified et l'écart net sur OSWorld 2.0 suggèrent que la difficulté supplémentaire de la v2 révèle une limite que la v1 masquait.

5. Le coût opérationnel

Trois signaux d'Artificial Analysis

  • Consommation élevée de jetons de sortie — conséquence directe du mode réflexion permanent et de l'effort max par défaut.
  • Vitesse de génération inférieure à la médiane.
  • Tarification premium relativement aux autres modèles ouverts.

Kimi K3 est le moins cher de son niveau de capacité et le plus cher et le plus lent parmi les modèles ouverts. Les deux sont vrais.

6. Les contraintes de déploiement

Contrainte Réalité
Taille 1,56 To — aucun GPU unique ne suffit
Matériel minimal Cluster multi-nœuds, ordre de 20+ GPU de classe H100/H200
Licence Pas open source ; conditions au-delà de 20 M$ de CA en MaaS
Historique de réflexion Doit être renvoyé tel quel, sinon le modèle se dégrade
MTP num_nextn_predict_layers: 0 — le décodage spéculatif décrit n'est pas reproductible depuis les seuls poids publics

Partie B — les angles morts du rapport

1. Les données — la lacune n° 1

Rien sur : le volume, les proportions, les sources, les langues, la date de coupure, le copyright, les seuils de filtrage, le taux de rejet de la vérification de fidélité.

Pourquoi c'est le plus grave

Les données comptent au moins autant que l'architecture. Leur absence rend :

  • toute reproduction impossible ;
  • l'attribution du « 2,5× » à l'architecture invérifiable — le rapport attribue lui-même le gain à l'architecture et aux recettes de données conjointement ;
  • toute analyse de contamination impossible.

2. L'algorithme de RL — la lacune n° 2

Le mécanisme central du RL long-horizon — la « régularisation par jeton » qui tolère un régime extrême hors-politique — est décrit en prose, sans équation. Le rapport renvoie à Kimi K2.5.

Manquent aussi : \(\lambda\), \(N\), \(K\), \(R_{\max}\), les \(\tau\) par domaine, le \(\sigma\) du contrôle de verbosité.

3. Aucune ablation

Le silence le plus surprenant

Le rapport introduit six innovations — décroissance bornée de KDA, porte de rang plein, AttnRes, SiTU-GLU, RMSNorm du LatentMoE, Per-Head Muon — et ne publie aucune ablation quantifiée pour aucune d'entre elles.

On lit « améliore la stabilité », « améliore constamment la perte de validation et les benchmarks », « donne un meilleur comportement d'entraînement ». Jamais de combien.

La seule figure d'ablation du papier est la courbe de normes de gradient de MoonViT — qui montre la stabilité, pas la performance.

Un lecteur ne peut donc pas savoir quelles innovations valent la peine d'être reprises. C'est la limite la plus handicapante pour la communauté.

4. Aucun budget de calcul

Ni GPU, ni durée, ni FLOPs, ni coût, ni empreinte carbone. C'est un recul par rapport à l'ère GPT-3 / Chinchilla / PaLM, où ces chiffres étaient publiés.

5. Le mélange des harnais dans les benchmarks

Déjà traité en Comprendre les benchmarks, mais il faut le répéter : les tableaux de codage mélangent Kimi Code, Claude Code, Codex et mini-SWE-agent. Ces scores ne sont pas des comparaisons de modèles à conditions égales.

6. Pas d'intervalles de confiance

Le nombre d'exécutions n'est précisé que pour la vision. Or le rapport commente des écarts de 0,2 point comme significatifs. Ils ne le sont vraisemblablement pas.

7. Pas d'analyse de contamination

Aucune mention, sur une quarantaine de bancs publics dont beaucoup sont antérieurs à l'entraînement. C'est une lacune commune à presque tous les rapports, mais elle reste une lacune.

8. Le coût de MOPD n'est pas mesuré

Neuf experts sont fusionnés en un modèle unique. Aucune comparaison entre le modèle unifié et les experts individuels n'est publiée. On ne sait pas ce que coûte l'unification, ni s'il y a interférence entre domaines.

9. Les hyperparamètres non justifiés

Plusieurs choix structurants sont donnés sans justification ni ablation :

Choix Statut
Ratio 3:1 KDA/MLA Hérité de Kimi Linear, non retesté pour K3
\(N = 8\) blocs AttnRes « empiriquement, \(N \approx 8\) récupère l'essentiel » — sans courbe
\(\ell = 0{,}5\,d\) Non justifié
\(N_s = 2\) experts partagés Non justifié
\(\beta_1 = 4\), \(\beta_2 = 25\) Non justifiés
\(k = 16\) sur \(E = 896\) Non justifié

Ce que cela implique si vous réimplémentez

Tous ces nombres sont à retester à votre échelle. Aucun n'est présenté comme une constante universelle, et rien n'indique qu'ils le soient.

Récapitulatif

LIMITES DU MODÈLE                        ANGLES MORTS DU RAPPORT
─────────────────                        ───────────────────────
raisonnement de recherche      ★★★       données                    ★★★
qualité du processus           ★★★       algorithme de RL           ★★★
généralisation cross-harnais   ★★        absence d'ablations        ★★★
usage d'ordinateur difficile   ★★        budget de calcul           ★★
coût / vitesse                 ★★        mélange des harnais        ★★
déploiement (1,56 To)          ★★        pas d'intervalles          ★★
licence non open source        ★         contamination              ★★
                                         coût de MOPD               ★
                                         hyperparamètres injustifiés ★

Chapitre précédent : Forces · Chapitre suivant : Affirmations à vérifier