Aller au contenu

Lois d'échelle et hyperparamètres

Pourquoi refaire une étude de loi d'échelle

Les lois d'échelle d'un modèle ne sont pas transférables à une architecture différente. Kimi K3 change l'attention, le résidu, le MoE et l'activation : les hyperparamètres optimaux de Kimi K2 n'ont aucune raison de rester valables.

L'équipe a donc conduit des études dédiées pour retuner :

Hyperparamètre Rôle
Taille de lot (batch size) Compromis entre stabilité et débit
Taux d'apprentissage Le paramètre le plus sensible
TPP (tokens per parameter) Combien de jetons par paramètre — le compromis Chinchilla
Forme du modèle Profondeur contre largeur contre nombre d'experts

Aucune valeur n'est publiée

Le rapport dit qu'il a retuné ces quantités. Il ne dit jamais quelles valeurs il a retenues. Ni le TPP, ni la taille de lot, ni le LR de pointe.

C'est une omission systématique et manifestement délibérée : ce sont les informations les plus directement réutilisables par un concurrent.

L'affirmation « 2,5× »

C'est le chiffre le plus repris de la sortie de Kimi K3. Il faut être précis sur ce qu'il signifie.

L'énoncé exact

Évaluées sur des données de validation hors distribution, les courbes de loi d'échelle montrent que ces améliorations délivrent collectivement un gain d'environ 2,5× en efficacité d'échelle globale par rapport à Kimi K2.

Comment le lire

Ce que « efficacité d'échelle » veut dire

Les deux modèles ont chacun une courbe reliant le calcul investi à la perte obtenue. Ces deux courbes sont décalées horizontalement. Le facteur 2,5 est ce décalage : à perte égale, Kimi K3 demande environ 2,5 fois moins de calcul que Kimi K2.

Formulé autrement par le blog : « chaque unité de calcul produit environ 2,5 fois plus d'intelligence qu'avant ».

Les cinq réserves

1. Le chiffre est collectif, pas décomposé

Le rapport attribue le gain à KDA, AttnRes, Stable LatentMoE, ET les recettes raffinées de données et d'entraînement, « collectivement ».

Aucune ablation ne dit combien vient de l'architecture et combien vient des données. Or on sait par ailleurs (voir Données) que les données ont considérablement évolué. Il est impossible de savoir si le gain architectural est de 2,5×, de 1,5× ou de 1,1×.

2. La figure n'a pas d'axes chiffrés

La figure 3 du rapport montre deux courbes ajustées. Elle ne porte ni échelle de calcul, ni valeurs de perte lisibles. Le lecteur ne peut pas vérifier l'ajustement, ni la plage sur laquelle il a été fait, ni le nombre de points.

3. Le jeu de validation est interne

« Held-out OOD validation data » — hors distribution, mais hors de quelle distribution ? Non publié. Une loi d'échelle mesurée sur un jeu proche des données d'entraînement du modèle nouveau surestimerait mécaniquement son avantage.

4. La perte n'est pas la capacité

Une amélioration de perte de validation ne se traduit pas linéairement en capacités. Le rapport lui-même montre que Kimi K3 reste derrière Claude Fable 5 et GPT-5.6 Sol sur plusieurs bancs, malgré ce gain.

5. Aucun tiers ne peut le vérifier

Reproduire cette mesure demanderait le corpus d'entraînement, les hyperparamètres et le jeu de validation. Aucun des trois n'est disponible.

Ce qu'on peut néanmoins retenir

Le chiffre est plausible. Kimi K3 a 2,7 fois plus de paramètres que K2 et 3,2 fois plus de paramètres actifs. Un modèle sans gain d'efficacité aurait un coût par jeton proportionnellement plus élevé. Que l'équipe revendique une amélioration substantielle de la courbe est cohérent avec les changements décrits.

Ce qu'il faut refuser, c'est de traiter « 2,5× » comme une mesure vérifiée et attribuable. C'est une revendication de constructeur, appuyée sur une figure non chiffrée.

Cosinus contre WSD : la partie la plus rigoureuse du rapport

Ce résultat mérite l'attention pour sa méthode, autant que pour sa conclusion.

Le contexte

Deux calendriers de taux d'apprentissage s'affrontent :

Calendrier Forme
Cosinus Décroissance en cosinus sur tout l'entraînement
WSD Warmup, puis long plateau, puis chute rapide à la fin

WSD est populaire parce qu'il permet de prolonger l'entraînement sans avoir fixé la durée à l'avance. Plusieurs travaux ont rapporté qu'il égale ou dépasse le cosinus.

Le résultat de Kimi K3

Le cosinus gagne systématiquement. L'équipe l'adopte comme calendrier par défaut.

L'argument méthodologique — le point important

Ce que l'équipe a compris

Les deux calendriers ont des hyperparamètres optimaux nettement différents. Le rapport est explicite : même à taille de modèle et budget de jetons identiques, leurs taux d'apprentissage de pointe et tailles de lot optimaux diffèrent substantiellement.

Conséquence : comparer les deux calendriers avec un jeu d'hyperparamètres partagé favorise mécaniquement celui auquel ces hyperparamètres conviennent le mieux — sans rien dire des calendriers eux-mêmes.

Leur protocole : conduire une recherche de loi d'échelle indépendante pour chaque calendrier, puis comparer chacun à son propre optimum. Sous cette condition, le cosinus atteint systématiquement une perte finale plus basse.

Une leçon généralisable

Cette erreur méthodologique — comparer deux méthodes sous les hyperparamètres optimaux d'une seule — est extrêmement répandue dans la littérature en apprentissage automatique. Elle explique une part considérable des résultats non reproductibles.

C'est aussi un rappel utile pour lire les comparaisons de benchmarks entre modèles : voir Comprendre les benchmarks.

Ce qui reste non résolu

Le rapport ne dit pas de combien le cosinus gagne, ni sur quelle plage de budgets, ni si l'écart se réduit à grande échelle. Le résultat est énoncé, pas quantifié.

Vérification de compréhension

Qu'est-ce que le TPP et pourquoi est-il critique ?

Tokens Per Parameter : le rapport entre le nombre de jetons d'entraînement et le nombre de paramètres. Les lois de Chinchilla suggéraient ~20 pour les modèles denses ; les pratiques modernes vont bien au-delà. Pour un MoE, la question est en outre ambiguë : faut-il compter les paramètres totaux ou actifs ? Le rapport ne tranche pas publiquement, et ne donne pas sa valeur.

Pourquoi ne pas simplement publier les hyperparamètres ?

Parce qu'ils constituent une part substantielle de l'avantage compétitif : la recherche de loi d'échelle est coûteuse (des dizaines d'entraînements de modèles intermédiaires), et ses résultats se transfèrent partiellement à d'autres architectures. C'est une rétention rationnelle — mais elle limite la valeur scientifique du rapport.


Chapitre précédent : Données de pré-entraînement · Chapitre suivant : Recette de pré-entraînement