L'effort de raisonnement¶
Le problème¶
Le nombre de jetons produits détermine directement le coût de service. Un modèle qui réfléchit longuement est plus précis et plus cher. Le compromis coût/qualité dépend de la tâche, et il devrait être choisi par l'utilisateur — pas figé dans les poids.
DeepSeek-V4.1-Flash expose donc un effort de raisonnement scalaire, un entier de 1 à 100, transmis dans le prompt.
Comment il est appris¶
L'effort n'est pas une astuce de prompt : il est construit pendant l'apprentissage par renforcement.
Le conditionnement¶
Une instruction est ajoutée au prompt système :
Reasoning Effort: {effort} (range 1-100; higher values request more
thorough reasoning)
L'échantillonnage par sous-groupes¶
Pour chaque prompt d'entraînement \(x\), on échantillonne \(M_b\) réponses à chaque niveau d'effort \(b \in \mathcal{B}\) :
Les réponses partageant le même couple \((x, b)\) forment un sous-groupe, à l'intérieur duquel les récompenses sont centrées pour calculer les avantages relatifs.
Le point clé de la conception
Les réponses de niveaux d'effort différents ne sont jamais comparées entre elles. Le comportement dépendant de l'effort est induit à l'intérieur de chaque sous-groupe, en faisant dépendre de \(b\) la seule composante de longueur de la récompense.
C'est ce qui évite l'écueil évident : si on comparait directement les réponses d'efforts différents, la politique apprendrait simplement à toujours utiliser le niveau le plus rentable.
La pénalité de longueur¶
| Symbole | Signification |
|---|---|
| \(\ell_{b,j}\) | nombre de jetons de raisonnement de la réponse |
| \(L_{\text{norm}}\) | longueur de référence |
| \(C_{\max}\) | plafond de la déduction appliquée à une trajectoire |
| \(k(b)\) | coefficient de pénalité, dépendant de l'effort |
Le coefficient décroît exponentiellement avec l'effort demandé :
où \(k_0\) est la pénalité de base, \(b_{\min}\) le niveau minimal, \(\Delta b\) l'espacement moyen entre niveaux d'entraînement, et \(\lambda\) le taux de décroissance.
Augmenter \(b\) de \(\tau\) multiplie le coefficient par \(e^{-1}\). Un \(\tau\) plus petit produit une séparation comportementale plus marquée entre niveaux.
L'annexe C du rapport technique motive la paramétrisation exponentielle par un argument d'utilité marginale.
L'interpolation¶
L'entraînement n'utilise qu'un nombre fini de niveaux d'effort. Pourtant, les valeurs intermédiaires fonctionnent au déploiement et produisent des comportements interpolés.
C'est ce qui fait de l'effort un réglage véritablement continu plutôt qu'un choix parmi trois presets.
Les paliers de l'API¶
En production depuis septembre 2026, l'API publique expose trois paliers :
| Palier API | Valeur \(b\) |
|---|---|
low |
50 |
high |
75 |
max |
100 |
Ces valeurs se retrouvent à l'identique dans le code d'encodage de prompt publié
avec les poids — le défaut y est "high" (75).
Ce que cela donne, mesuré¶
Toutes les mesures ci-dessous proviennent de DeepSeek.
Sur les grands agrégats¶
Passer de l'effort 25 à 100 :
| Métrique | Effort 25 | Effort 100 | Gain |
|---|---|---|---|
| Moyenne sur 8 benchmarks de raisonnement | 67,1 % | 76,3 % | +9,2 |
| DeepSWE v1.1 | 66,0 % | 74,2 % | +8,2 |
| Terminal-Bench 2.1 | 82,4 % | 90,6 % | +8,2 |
| Jetons produits | — | — | × 2,5 |
La forme de la courbe¶
C'est le point pratiquement le plus utile du rapport :
Les gains sont concentrés à l'avant
« La plage 60–80 récupère déjà l'essentiel de la précision du réglage maximal pour moins de la moitié de son budget en jetons, tandis que l'ultime pas vers l'effort 100 allonge les trajectoires d'agent d'un facteur 1,6 à 1,8 pour une amélioration seulement marginale. »
Conclusion de DeepSeek : le palier maximal est à réserver aux tâches les plus difficiles ; les niveaux modérés offrent un meilleur rapport coût/performance pour l'usage agentique courant.
Un transfert non évident¶
L'effort est appris sur du raisonnement à réponse unique. Il se transfère fidèlement aux trajectoires agentiques longues, où il gouverne la quantité totale d'exploration et de vérification à travers les tours.
Ce n'était pas garanti : rien dans la formulation de la récompense ne mentionne le nombre de tours d'un agent.
La prévisibilité¶
L'annexe B.3 donne une propriété importante pour la planification de budget : sur les huit benchmarks de raisonnement, passer de l'effort 25 à 100 multiplie la longueur moyenne de réponse par 2,0 à 3,1 de façon uniforme, sans emballement ni anomalie. Le coût de calcul d'un palier peut donc être estimé à l'avance.
Côté précision, aucun benchmark ne se dégrade quand l'effort augmente. MathArena Apex 2025 gagne 40,3 points (25,3 % → 65,6 %), AIME 2026 atteint 100 %.
La nuance sur les harnais¶
L'annexe B.2 apporte une correction importante à ce tableau optimiste :
L'effort dicte la longueur, pas la précision
« Sur les six panneaux de la figure 11, augmenter le réglage d'effort allonge les trajectoires : les jetons de sortie moyens croissent monotoniquement avec l'effort dans chaque paire harnais-benchmark. Le Pass@1 ne suit cette croissance que de façon lâche. Il s'améliore globalement, mais la réponse n'est pas monotone, avec des plateaux et des creux à des réglages intermédiaires dans la plupart des panneaux. »
Et : « le choix du harnais compte au moins autant que le palier d'effort une fois que la tâche est presque saturée. »
Autrement dit, la belle monotonie observée sur les moyennes disparaît quand on regarde harnais par harnais.
Partie suivante : Évaluations