Lois d'échelle et hyperparamètres¶
Pourquoi refaire une étude de loi d'échelle¶
Les lois d'échelle d'un modèle ne sont pas transférables à une architecture différente. Kimi K3 change l'attention, le résidu, le MoE et l'activation : les hyperparamètres optimaux de Kimi K2 n'ont aucune raison de rester valables.
L'équipe a donc conduit des études dédiées pour retuner :
| Hyperparamètre | Rôle |
|---|---|
| Taille de lot (batch size) | Compromis entre stabilité et débit |
| Taux d'apprentissage | Le paramètre le plus sensible |
| TPP (tokens per parameter) | Combien de jetons par paramètre — le compromis Chinchilla |
| Forme du modèle | Profondeur contre largeur contre nombre d'experts |
Aucune valeur n'est publiée
Le rapport dit qu'il a retuné ces quantités. Il ne dit jamais quelles valeurs il a retenues. Ni le TPP, ni la taille de lot, ni le LR de pointe.
C'est une omission systématique et manifestement délibérée : ce sont les informations les plus directement réutilisables par un concurrent.
L'affirmation « 2,5× »¶
C'est le chiffre le plus repris de la sortie de Kimi K3. Il faut être précis sur ce qu'il signifie.
L'énoncé exact¶
Évaluées sur des données de validation hors distribution, les courbes de loi d'échelle montrent que ces améliorations délivrent collectivement un gain d'environ 2,5× en efficacité d'échelle globale par rapport à Kimi K2.
Comment le lire¶
Ce que « efficacité d'échelle » veut dire
Les deux modèles ont chacun une courbe reliant le calcul investi à la perte obtenue. Ces deux courbes sont décalées horizontalement. Le facteur 2,5 est ce décalage : à perte égale, Kimi K3 demande environ 2,5 fois moins de calcul que Kimi K2.
Formulé autrement par le blog : « chaque unité de calcul produit environ 2,5 fois plus d'intelligence qu'avant ».
Les cinq réserves¶
1. Le chiffre est collectif, pas décomposé
Le rapport attribue le gain à KDA, AttnRes, Stable LatentMoE, ET les recettes raffinées de données et d'entraînement, « collectivement ».
Aucune ablation ne dit combien vient de l'architecture et combien vient des données. Or on sait par ailleurs (voir Données) que les données ont considérablement évolué. Il est impossible de savoir si le gain architectural est de 2,5×, de 1,5× ou de 1,1×.
2. La figure n'a pas d'axes chiffrés
La figure 3 du rapport montre deux courbes ajustées. Elle ne porte ni échelle de calcul, ni valeurs de perte lisibles. Le lecteur ne peut pas vérifier l'ajustement, ni la plage sur laquelle il a été fait, ni le nombre de points.
3. Le jeu de validation est interne
« Held-out OOD validation data » — hors distribution, mais hors de quelle distribution ? Non publié. Une loi d'échelle mesurée sur un jeu proche des données d'entraînement du modèle nouveau surestimerait mécaniquement son avantage.
4. La perte n'est pas la capacité
Une amélioration de perte de validation ne se traduit pas linéairement en capacités. Le rapport lui-même montre que Kimi K3 reste derrière Claude Fable 5 et GPT-5.6 Sol sur plusieurs bancs, malgré ce gain.
5. Aucun tiers ne peut le vérifier
Reproduire cette mesure demanderait le corpus d'entraînement, les hyperparamètres et le jeu de validation. Aucun des trois n'est disponible.
Ce qu'on peut néanmoins retenir
Le chiffre est plausible. Kimi K3 a 2,7 fois plus de paramètres que K2 et 3,2 fois plus de paramètres actifs. Un modèle sans gain d'efficacité aurait un coût par jeton proportionnellement plus élevé. Que l'équipe revendique une amélioration substantielle de la courbe est cohérent avec les changements décrits.
Ce qu'il faut refuser, c'est de traiter « 2,5× » comme une mesure vérifiée et attribuable. C'est une revendication de constructeur, appuyée sur une figure non chiffrée.
Cosinus contre WSD : la partie la plus rigoureuse du rapport¶
Ce résultat mérite l'attention pour sa méthode, autant que pour sa conclusion.
Le contexte¶
Deux calendriers de taux d'apprentissage s'affrontent :
| Calendrier | Forme |
|---|---|
| Cosinus | Décroissance en cosinus sur tout l'entraînement |
| WSD | Warmup, puis long plateau, puis chute rapide à la fin |
WSD est populaire parce qu'il permet de prolonger l'entraînement sans avoir fixé la durée à l'avance. Plusieurs travaux ont rapporté qu'il égale ou dépasse le cosinus.
Le résultat de Kimi K3¶
Le cosinus gagne systématiquement. L'équipe l'adopte comme calendrier par défaut.
L'argument méthodologique — le point important¶
Ce que l'équipe a compris
Les deux calendriers ont des hyperparamètres optimaux nettement différents. Le rapport est explicite : même à taille de modèle et budget de jetons identiques, leurs taux d'apprentissage de pointe et tailles de lot optimaux diffèrent substantiellement.
Conséquence : comparer les deux calendriers avec un jeu d'hyperparamètres partagé favorise mécaniquement celui auquel ces hyperparamètres conviennent le mieux — sans rien dire des calendriers eux-mêmes.
Leur protocole : conduire une recherche de loi d'échelle indépendante pour chaque calendrier, puis comparer chacun à son propre optimum. Sous cette condition, le cosinus atteint systématiquement une perte finale plus basse.
Une leçon généralisable
Cette erreur méthodologique — comparer deux méthodes sous les hyperparamètres optimaux d'une seule — est extrêmement répandue dans la littérature en apprentissage automatique. Elle explique une part considérable des résultats non reproductibles.
C'est aussi un rappel utile pour lire les comparaisons de benchmarks entre modèles : voir Comprendre les benchmarks.
Ce qui reste non résolu¶
Le rapport ne dit pas de combien le cosinus gagne, ni sur quelle plage de budgets, ni si l'écart se réduit à grande échelle. Le résultat est énoncé, pas quantifié.
Vérification de compréhension¶
Qu'est-ce que le TPP et pourquoi est-il critique ?
Tokens Per Parameter : le rapport entre le nombre de jetons d'entraînement et le nombre de paramètres. Les lois de Chinchilla suggéraient ~20 pour les modèles denses ; les pratiques modernes vont bien au-delà. Pour un MoE, la question est en outre ambiguë : faut-il compter les paramètres totaux ou actifs ? Le rapport ne tranche pas publiquement, et ne donne pas sa valeur.
Pourquoi ne pas simplement publier les hyperparamètres ?
Parce qu'ils constituent une part substantielle de l'avantage compétitif : la recherche de loi d'échelle est coûteuse (des dizaines d'entraînements de modèles intermédiaires), et ses résultats se transfèrent partiellement à d'autres architectures. C'est une rétention rationnelle — mais elle limite la valeur scientifique du rapport.
Chapitre précédent : Données de pré-entraînement · Chapitre suivant : Recette de pré-entraînement