Aller au contenu

L'effort de raisonnement

Kimi K3 expose trois niveaux — low, high, max — et le défaut est max. Ce chapitre explique comment ils sont fabriqués.

Ce que ce n'est pas

Erreurs fréquentes

  • Ce n'est pas un paramètre de décodage (comme la température).
  • Ce n'est pas une limite de jetons imposée à l'inférence.
  • Ce ne sont pas trois modèles différents servis séparément.

Ce sont trois comportements appris par un modèle unique, conditionné par une instruction en contexte.

Le mécanisme d'entraînement : le contrôle de budget par problème

À chaque problème \(x\) est associé un budget de jetons initial \(b_0(x)\), estimé à partir du modèle de démarrage à froid — c'est-à-dire : combien de jetons ce problème demande-t-il typiquement ?

La récompense de la tâche est alors écrasée par \(-1\) pour toute trajectoire qui dépasse un seuil mis à l'échelle :

\[ r(x, y) = \begin{cases} -1, & T(y) > \tau \cdot b_0(x) \\[4pt] R_{\mathrm{tâche}}(y \mid x), & \text{sinon} \end{cases} \]
Symbole Signification
\(T(y)\) Le compte de jetons de la trajectoire \(y\)
\(b_0(x)\) Budget de référence pour le problème \(x\)
\(\tau\) Multiplicateur de budget — le levier de contrôle
\(R_{\mathrm{tâche}}\) La récompense normale de la tâche

Ce que \(T(y)\) compte, selon le type de tâche

Type de tâche \(T(y)\) mesure
Tâches générales Le nombre de jetons de réflexion
Tâches agentiques Les jetons de sortie cumulés, traces de raisonnement et arguments d'appels d'outils inclus

Pourquoi cette distinction

Sur une tâche agentique, limiter uniquement la réflexion serait contourné trivialement : le modèle déplacerait son effort vers un plus grand nombre d'appels d'outils. Compter la sortie totale ferme cette échappatoire.

Le choix d'une sanction brutale

Dépasser le budget ne coûte pas une pénalité proportionnelle : la récompense devient \(-1\), quelle que soit la qualité de la réponse. Une solution parfaite mais trop longue vaut moins qu'un échec bref.

C'est délibéré. Une pénalité douce serait négociable : le modèle apprendrait à « payer » la pénalité quand la qualité en vaut la peine. Un mur ne se négocie pas.

Le curriculum : de max vers low

étape 1 :  τ grand      →  expert MAX-BUDGET
           (mais plafonné, pour supprimer la sur-réflexion excessive)
                │
                ▼  on diminue τ
étape 2 :  τ moyen      →  expert HIGH
                │
                ▼  on diminue τ
étape 3 :  τ petit      →  expert LOW

Deux points de méthode notables :

Un plafond même pour max

Le rapport précise que la variante max-budget est entraînée avec un \(\tau\) relativement grand, tout en plafonnant le budget maximal pour supprimer la sur-réflexion excessive (to suppress excessive overthinking).

Autrement dit : même le mode max n'est pas « réfléchis autant que tu veux ». Il existe un plafond, parce qu'un raisonnement qui s'étire indéfiniment est un mode de défaillance, pas une capacité.

Le réglage est humain, par domaine

L'ajustement de \(\tau\) est configured per domain under human-in-the-loop guidance. Il n'est ni automatique ni uniforme : un problème de mathématiques et une session d'ingénierie logicielle n'ont pas les mêmes courbes de rendement décroissant.

L'intuition

Ce que le modèle apprend réellement

On ne lui apprend pas à « réfléchir moins ». On lui apprend à obtenir le même résultat dans un budget contraint.

Sous contrainte, la stratégie payante n'est pas de tronquer la conclusion — ce qui ferait échouer la tâche — mais de supprimer les détours : l'exploration redondante, les vérifications superflues, les reformulations.

C'est pourquoi low n'est pas simplement une version dégradée : c'est une politique différente, plus directe.

La récolte des trajectoires

L'articulation avec MOPD

Les trajectoires produites par les experts résultants à tous les niveaux de raisonnement sont collectées conjointement pour l'ajustement supervisé et la distillation multi-professeurs.

Les neuf experts ne sont donc pas des produits finaux : ce sont des générateurs de données et des professeurs. Le modèle livré est celui issu de MOPD.

Côté utilisateur

L'effort se règle par un champ de requête de premier niveau, reasoning_effort, avec les valeurs "low", "high", "max" (défaut "max").

Techniquement, il est traduit en un message d'option globale de type thinking-effort, inséré après la déclaration d'outils et avant les messages d'entrée, qui énonce le niveau demandé en langage naturel.

Le schéma réserve quatre niveaux (low, medium, high, max) dont K3 supporte un sous-ensemble — medium est réservé pour l'avenir.

Conséquence sur le cache KV

Comme l'effort est une option globale placée en tête de contexte, changer d'effort en cours de session invalide tout le cache KV. Ce n'est pas un réglage à faire varier à la légère dans une session agentique longue.

Ce que cela coûte et rapporte

Le rapport donne un chiffre sur l'arbitrage effort/coût :

Sur Kimi Code Bench 2.0

À effort max, Kimi K3 est 4,0 points derrière Claude Fable 5, pour 38 % de son coût.

À effort high, il égale déjà le score d'effort maximal de Claude Opus 4.8, pour environ un tiers du coût.

C'est l'argument commercial central : l'effort n'est pas seulement une fonctionnalité, c'est un curseur de coût que l'utilisateur contrôle.

Vérification de compréhension

Pourquoi estimer \(b_0(x)\) sur le modèle de démarrage à froid plutôt que fixer un budget uniforme ?

Parce que les problèmes n'ont pas la même difficulté intrinsèque. Un budget uniforme punirait mécaniquement les problèmes durs et laisserait toute latitude aux problèmes faciles. En calibrant sur ce que le modèle de départ consomme naturellement, \(\tau\) devient un facteur relatif comparable entre problèmes.

Le mode low est-il utilisable pour des tâches agentiques ?

Rien ne l'interdit, et le rapport a entraîné des experts low pour les trois domaines, agents compris. Mais toutes les évaluations publiées de K3 sont conduites à effort max, sauf la mention explicite de Kimi Code Bench à high. On ne dispose donc pas de mesure systématique de la dégradation entre max et low.

Trois efforts × trois domaines = neuf experts. Combien coûte cet entraînement ?

Non publié. Mais c'est manifestement neuf entraînements RL complets sur un modèle de 2,8 T de paramètres, plus la distillation. C'est probablement le poste le plus coûteux de tout le post-entraînement.


Chapitre précédent : Apprentissage par renforcement · Chapitre suivant : Distillation multi-professeurs