Aller au contenu

03 · Dérivation

Intuition

La dérivée mesure la vitesse de variation d'une fonction en un point.

Géométriquement, c'est la pente de la tangente. Physiquement, c'est la vitesse instantanée. Numériquement, c'est le facteur par lequel une petite variation de l'entrée est multipliée pour donner la variation de la sortie :

\[ f(a+h)\approx f(a)+f'(a)h \]

Cette dernière lecture est la plus utile : dériver, c'est linéariser localement. C'est aussi ce qui fait de la dérivée l'outil central de l'optimisation, où l'on cherche les points où la pente s'annule.

1. Nombre dérivé

Définition

\(f\) est dérivable en \(a\) si la limite

\[ f'(a) = \lim_{h\to0}\frac{f(a+h)-f(a)}{h} = \lim_{x\to a}\frac{f(x)-f(a)}{x-a} \]

existe et est finie. Cette limite est le nombre dérivé de \(f\) en \(a\).

Le quotient \(\frac{f(a+h)-f(a)}{h}\) est le taux d'accroissement : c'est la pente de la corde entre les points d'abscisses \(a\) et \(a+h\). La dérivée est la limite de cette pente quand la corde devient tangente.

Équation de la tangente en \(a\) :

\[ y = f'(a)(x-a) + f(a) \]

Dérivabilité entraîne continuité

Si \(f\) est dérivable en \(a\), alors \(f\) est continue en \(a\).

En effet, \(f(x)-f(a) = \frac{f(x)-f(a)}{x-a}\times(x-a) \to f'(a)\times0 = 0\).

La réciproque est fausse

\(x\mapsto|x|\) est continue en 0 mais pas dérivable : le taux d'accroissement vaut \(\frac{|h|}{h}\), qui tend vers \(1\) à droite et \(-1\) à gauche.

Le point anguleux est l'obstruction typique. Une tangente verticale en est une autre : \(x\mapsto\sqrt x\) n'est pas dérivable en 0, le taux tendant vers \(+\infty\).

2. Formules de dérivation

2.1 Dérivées usuelles

\(f(x)\) \(f'(x)\) Domaine de dérivabilité
\(k\) (constante) \(0\) \(\mathbb{R}\)
\(x^n\), \(n\in\mathbb{Z}\) \(nx^{n-1}\) \(\mathbb{R}\) (ou \(\mathbb{R}^*\) si \(n<0\))
\(x^\alpha\), \(\alpha\in\mathbb{R}\) \(\alpha x^{\alpha-1}\) \(\mathbb{R}^{+*}\)
\(\sqrt x\) \(\dfrac{1}{2\sqrt x}\) \(\mathbb{R}^{+*}\)
\(\dfrac1x\) \(-\dfrac{1}{x^2}\) \(\mathbb{R}^*\)
\(e^x\) \(e^x\) \(\mathbb{R}\)
\(\ln x\) \(\dfrac1x\) \(\mathbb{R}^{+*}\)
\(\sin x\) \(\cos x\) \(\mathbb{R}\)
\(\cos x\) \(-\sin x\) \(\mathbb{R}\)
\(\tan x\) \(1+\tan^2 x = \dfrac{1}{\cos^2x}\) \(x\neq\frac\pi2+k\pi\)

2.2 Règles de calcul

\[ (u+v)' = u'+v' \qquad (ku)' = ku' \]
\[ \boxed{(uv)' = u'v+uv'} \qquad \boxed{\left(\frac uv\right)' = \frac{u'v-uv'}{v^2}} \]
\[ \boxed{(v\circ u)'(x) = u'(x)\cdot v'\big(u(x)\big)} \]

Les trois erreurs de règles

  • \((uv)' \neq u'v'\). Il y a deux termes.
  • Dans \(\left(\frac uv\right)'\), le numérateur est \(u'v - uv'\) : l'ordre compte, et le signe moins est au milieu.
  • Pour la composée, on multiplie par la dérivée de l'intérieur. Oublier \(u'\) est l'erreur la plus fréquente de tout le chapitre.

2.3 Composées usuelles

Ce tableau évite de réappliquer la règle de la chaîne à chaque fois.

Fonction Dérivée
\(u^n\) \(nu'u^{n-1}\)
\(\sqrt u\) \(\dfrac{u'}{2\sqrt u}\)
\(\dfrac1u\) \(-\dfrac{u'}{u^2}\)
\(e^u\) \(u'e^u\)
\(\ln u\) \(\dfrac{u'}{u}\)
\(\sin u\) \(u'\cos u\)
\(\cos u\) \(-u'\sin u\)

La forme \(\dfrac{u'}{u}\)

C'est la plus utile de toutes : elle se reconnaît dans un sens (dériver un logarithme) et dans l'autre (primitiver une fraction). On la retrouvera au chapitre 06.

Exemple : \(\dfrac{2x}{x^2+1}\) est la dérivée de \(\ln(x^2+1)\).

3. Dérivée et variations

Théorème (admis, conséquence du TAF)

Soit \(f\) dérivable sur un intervalle \(I\).

Signe de \(f'\) sur \(I\) Variation de \(f\)
\(f' > 0\) strictement croissante
\(f' < 0\) strictement décroissante
\(f' = 0\) partout constante

Le point où \(f'\) s'annule n'est pas toujours un extremum

\(f(x)=x^3\) vérifie \(f'(0)=0\), mais \(f\) est strictement croissante partout : il n'y a pas d'extremum en 0, mais un point d'inflexion à tangente horizontale.

La bonne condition : \(f\) admet un extremum local en \(a\) si \(f'\) change de signe en \(a\).

Extremum et dérivée nulle

Si \(f\) est dérivable sur un intervalle ouvert et admet un extremum local en \(a\), alors \(f'(a)=0\).

L'hypothèse « ouvert » compte : sur \([0;1]\), \(f(x)=x\) atteint son maximum en 1 sans que \(f'(1)=0\).

4. Théorèmes fondamentaux

Théorème de Rolle

Si \(f\) est continue sur \([a;b]\), dérivable sur \(]a;b[\), et \(f(a)=f(b)\), alors il existe \(c\in]a;b[\) tel que \(f'(c)=0\).

Interprétation : si la fonction revient à sa valeur de départ, elle a nécessairement fait demi-tour quelque part, donc sa pente s'est annulée.

Théorème des accroissements finis (TAF)

Si \(f\) est continue sur \([a;b]\) et dérivable sur \(]a;b[\), il existe \(c\in]a;b[\) tel que

\[ f(b)-f(a) = f'(c)\,(b-a) \]

Interprétation : la pente moyenne entre \(a\) et \(b\) est atteinte au moins une fois comme pente instantanée. Si vous parcourez 100 km en 1 h, votre vitesse instantanée a valu 100 km/h à un instant au moins.

Inégalité des accroissements finis

Si \(|f'| \leqslant M\) sur \([a;b]\), alors

\[ |f(b)-f(a)| \leqslant M\,|b-a| \]

C'est le résultat qui permet de majorer une erreur en analyse numérique. Une fonction à dérivée bornée ne peut pas varier plus vite que \(M\).

5. Dérivées successives

\(f'' = (f')'\), et plus généralement \(f^{(n)}\).

Interprétation du signe de \(f''\) :

  • \(f''>0\) : \(f'\) croît, la courbe est convexe (tournée vers le haut, au-dessus de ses tangentes) ;
  • \(f''<0\) : la courbe est concave ;
  • \(f''\) change de signe : point d'inflexion.

Pourquoi la convexité compte

En optimisation, une fonction convexe n'a qu'un seul minimum, qui est global. C'est ce qui rend le problème facile — et c'est exactement le contenu du module OSCO23 en deuxième année : « convexité, conditions d'existence d'un extremum local, conditions d'existence d'un extremum global ».

Exemples traités

Exemple 1 — Chaîne de dérivation

Dériver \(f(x) = \sqrt{3x^2+1}\).

Posons \(u(x)=3x^2+1\), donc \(u'(x)=6x\).

\[ f'(x) = \frac{u'}{2\sqrt u} = \frac{6x}{2\sqrt{3x^2+1}} = \frac{3x}{\sqrt{3x^2+1}} \]

Vérification de cohérence : \(f\) est paire, donc \(f'\) doit être impaire. C'est le cas ✓ Et \(f'(0)=0\), cohérent avec le minimum en 0.

Exemple 2 — Quotient

Dériver \(g(x)=\dfrac{x^2+1}{x-2}\) sur \(\mathbb{R}\setminus\{2\}\).

\(u = x^2+1\), \(u'=2x\) ; \(v = x-2\), \(v'=1\).

\[ g'(x) = \frac{2x(x-2)-(x^2+1)\times1}{(x-2)^2} = \frac{2x^2-4x-x^2-1}{(x-2)^2} = \frac{x^2-4x-1}{(x-2)^2} \]

Signe : le dénominateur est positif, donc \(g'\) a le signe de \(x^2-4x-1\), de discriminant \(16+4 = 20\), de racines \(2\pm\sqrt5\).

\(g\) est croissante sur \(]-\infty;2-\sqrt5]\), décroissante sur \([2-\sqrt5;2[\) puis sur \(]2;2+\sqrt5]\), croissante ensuite.

Exemple 3 — Dérivée d'un produit de trois facteurs

Dériver \(h(x) = x\,e^x\sin x\).

On applique deux fois la règle du produit. Avec \(u = x\), \(v = e^x\sin x\) :

\[ v' = e^x\sin x + e^x\cos x = e^x(\sin x+\cos x) \]
\[ h' = 1\cdot e^x\sin x + x\cdot e^x(\sin x+\cos x) = e^x\big[\sin x + x\sin x + x\cos x\big] \]

Formule générale

\((uvw)' = u'vw + uv'w + uvw'\) — un terme par facteur dérivé. Elle se généralise à \(n\) facteurs.

Exemple 4 — Utiliser l'inégalité des accroissements finis

Montrer que pour tous \(x,y\in\mathbb{R}\) : \(|\sin x - \sin y|\leqslant|x-y|\).

La fonction \(\sin\) est dérivable sur \(\mathbb{R}\), de dérivée \(\cos\), et \(|\cos t|\leqslant1\) pour tout \(t\).

Par l'inégalité des accroissements finis avec \(M=1\) :

\[ |\sin x-\sin y| \leqslant 1\times|x-y| \]

\(\blacksquare\)

Cas particulier avec \(y=0\) : \(|\sin x|\leqslant|x|\), l'inégalité de référence annoncée au chapitre 01.

Erreurs fréquentes

Erreur Correction
\((uv)'=u'v'\) \(u'v+uv'\)
Oublier \(u'\) dans une composée \((e^u)' = u'e^u\)
Numérateur du quotient dans le désordre \(u'v - uv'\)
\(f'(a)=0 \implies\) extremum Il faut un changement de signe
Dériver \(x^x\) comme \(x\cdot x^{x-1}\) Passer par \(e^{x\ln x}\)
Confondre \(f'\) et \(f''\) dans la convexité \(f''\) donne la convexité

Exercices

★ Exercice 1. Dériver.

a) \(f(x)=3x^4-2x^2+7\) b) \(g(x)=\dfrac{1}{x^3}\) c) \(h(x)=5\sqrt x\) d) \(k(x)=e^{2x}\)

★ Exercice 2. Dériver en utilisant produit ou quotient.

a) \(f(x)=x^2 e^x\) b) \(g(x)=\dfrac{\sin x}{x}\) c) \(h(x)=x\ln x\) d) \(k(x)=\dfrac{e^x}{1+x^2}\)

★★ Exercice 3. Dériver (composées).

a) \(f(x)=(2x+1)^7\) b) \(g(x)=\ln(x^2+3)\) c) \(h(x)=e^{-x^2}\) d) \(k(x)=\sqrt{\cos x}\) e) \(m(x)=\sin^3(2x)\)

★★ Exercice 4. Déterminer l'équation de la tangente à \(\mathcal{C}_f\) au point d'abscisse \(a\).

a) \(f(x)=x^2\), \(a=3\) b) \(f(x)=\ln x\), \(a=1\) c) \(f(x)=e^x\), \(a=0\)

★★ Exercice 5. Étudier les variations de

\[ f(x) = \frac{x}{x^2+1} \]

sur \(\mathbb{R}\), et déterminer ses extremums.

★★★ Exercice 6. Démontrer les inégalités de référence.

a) \(e^x \geqslant 1+x\) pour tout \(x\in\mathbb{R}\) b) \(\ln x \leqslant x-1\) pour tout \(x>0\) c) En déduire que ces deux inégalités sont équivalentes.

★★★ Exercice 7. Soit \(f(x)=x^3-3x+1\).

a) Étudier ses variations. b) Montrer que l'équation \(f(x)=0\) admet exactement trois solutions réelles. c) Localiser chacune à \(0{,}5\) près.

★★★ Exercice 8. Soit \(f\) dérivable sur \(\mathbb{R}\) telle que \(f'(x) = f(x)\) pour tout \(x\), et \(f(0)=1\).

Montrer que \(f(x)=e^x\).

Indication : étudiez \(g(x)=f(x)e^{-x}\).

★★★★ Exercice 9. Soit \(f\) deux fois dérivable sur \([a;b]\) avec \(f(a)=f(b)=0\) et \(f\) non identiquement nulle.

a) Montrer qu'il existe \(c\in]a;b[\) avec \(f'(c)=0\). b) Si de plus \(f\left(\frac{a+b}{2}\right)=0\), montrer qu'il existe \(d\in]a;b[\) tel que \(f''(d)=0\). c) Généraliser : si \(f\) s'annule en \(n+1\) points distincts et est \(n\) fois dérivable, que peut-on dire de \(f^{(n)}\) ?

★★★★ Exercice 10 — lien informatique. La descente de gradient minimise une fonction \(f\) par \(x_{n+1} = x_n - \eta f'(x_n)\), où \(\eta>0\) est le pas.

a) Sur \(f(x)=x^2\), calculer \(x_n\) explicitement en fonction de \(x_0\) et \(\eta\). b) Pour quelles valeurs de \(\eta\) la méthode converge-t-elle ? c) Quelle valeur de \(\eta\) donne la convergence la plus rapide ? d) Sur \(f(x)=ax^2\) avec \(a>0\), généraliser. Quel est le lien avec la dérivée seconde ? e) Implémenter et vérifier numériquement.


Corrigés

Corrigé — Exercice 1

a) \(f'(x)=12x^3-4x\).

b) \(g(x)=x^{-3}\), donc \(g'(x)=-3x^{-4} = -\dfrac{3}{x^4}\).

c) \(h'(x)=\dfrac{5}{2\sqrt x}\).

d) \(k'(x) = 2e^{2x}\) (composée avec \(u=2x\), \(u'=2\)).

Corrigé — Exercice 2

a) \(f'(x) = 2xe^x + x^2e^x = e^x(x^2+2x) = xe^x(x+2)\).

b) \(g'(x) = \dfrac{x\cos x - \sin x}{x^2}\).

c) \(h'(x) = \ln x + x\cdot\dfrac1x = \ln x + 1\).

d) \(k'(x) = \dfrac{e^x(1+x^2) - e^x\cdot 2x}{(1+x^2)^2} = \dfrac{e^x(x^2-2x+1)}{(1+x^2)^2} = \dfrac{e^x(x-1)^2}{(1+x^2)^2}\).

Info

\(k'\geqslant0\) partout, avec égalité seulement en \(x=1\) : \(k\) est strictement croissante sur \(\mathbb{R}\), avec une tangente horizontale en \(x=1\) — un point d'inflexion, pas un extremum.

Corrigé — Exercice 3

a) \(f'(x)=7\times2\times(2x+1)^6 = 14(2x+1)^6\).

b) \(g'(x)=\dfrac{2x}{x^2+3}\).

c) \(h'(x)=-2x\,e^{-x^2}\).

d) \(k'(x) = \dfrac{-\sin x}{2\sqrt{\cos x}}\), définie là où \(\cos x > 0\).

e) \(m(x) = \big(\sin(2x)\big)^3\).

\[ m'(x) = 3\big(\sin 2x\big)^2\times\big(\sin 2x\big)' = 3\sin^2(2x)\times2\cos(2x) = 6\sin^2(2x)\cos(2x) \]

Deux composées imbriquées : d'abord le cube, puis le sinus, puis \(2x\).

Corrigé — Exercice 4

a) \(f'(x)=2x\), \(f'(3)=6\), \(f(3)=9\).

\[ y = 6(x-3)+9 = 6x-9 \]

b) \(f'(x)=\frac1x\), \(f'(1)=1\), \(f(1)=0\).

\[ y = x-1 \]

(C'est la tangente qui donne l'inégalité \(\ln x\leqslant x-1\).)

c) \(f'(0)=1\), \(f(0)=1\).

\[ y = x+1 \]

(Et c'est la tangente qui donne \(e^x\geqslant1+x\).)

Corrigé — Exercice 5
\[ f'(x) = \frac{1\cdot(x^2+1) - x\cdot 2x}{(x^2+1)^2} = \frac{1-x^2}{(x^2+1)^2} \]

Le dénominateur est positif : \(f'\) a le signe de \(1-x^2 = (1-x)(1+x)\).

\(x\) \(-\infty\) \(-1\) \(1\) \(+\infty\)
\(f'\) \(-\) 0 \(+\) 0 \(-\)
\(f\) ↘ \(-\frac12\) ↗ \(\frac12\) ↘

Minimum \(f(-1)=-\dfrac12\), maximum \(f(1)=\dfrac12\).

Limites en \(\pm\infty\) : \(f(x)\sim\frac{x}{x^2}=\frac1x\to0\).

On retrouve le résultat de l'exercice 5 du chapitre 01 : \(|f|\leqslant\frac12\) ici (la fonction de ce chapitre-là était \(\frac{2x}{1+x^2}\), deux fois celle-ci).

Corrigé — Exercice 6

a) Posons \(g(x)=e^x-1-x\), dérivable sur \(\mathbb{R}\).

\[ g'(x) = e^x - 1 \]

\(g'(x)<0\) pour \(x<0\), \(g'(x)>0\) pour \(x>0\) : \(g\) admet un minimum global en 0, valant \(g(0) = 1-1-0 = 0\).

Donc \(g(x)\geqslant0\) pour tout \(x\), soit \(e^x\geqslant1+x\). \(\blacksquare\)

b) Posons \(h(x)=x-1-\ln x\) sur \(\mathbb{R}^{+*}\).

\[ h'(x) = 1-\frac1x = \frac{x-1}{x} \]

Négative sur \(]0;1[\), positive sur \(]1;+\infty[\) : minimum en 1, valant \(h(1)=0\).

Donc \(h(x)\geqslant0\), soit \(\ln x\leqslant x-1\). \(\blacksquare\)

c) Dans a), posons \(x = \ln t\) pour \(t>0\) :

\[ e^{\ln t} \geqslant 1+\ln t \iff t \geqslant 1+\ln t \iff \ln t\leqslant t-1 \]

C'est exactement b). Réciproquement, poser \(t = e^x\) dans b) redonne a).

Les deux inégalités sont donc la même, lue de deux côtés — c'est logique, puisque \(\exp\) et \(\ln\) sont réciproques et que leurs courbes sont symétriques par rapport à \(y=x\), tout comme leurs tangentes de référence \(y=x+1\) et \(y=x-1\). \(\blacksquare\)

Corrigé — Exercice 7

a) \(f'(x)=3x^2-3 = 3(x-1)(x+1)\).

\(x\) \(-\infty\) \(-1\) \(1\) \(+\infty\)
\(f'\) \(+\) 0 \(-\) 0 \(+\)
\(f\) \(-\infty\) ↗ 3 ↘ \(-1\) ↗ \(+\infty\)

(\(f(-1) = -1+3+1 = 3\) et \(f(1)=1-3+1=-1\).)

b) Trois branches strictement monotones, avec changement de signe sur chacune :

  • sur \(]-\infty;-1]\) : de \(-\infty\) à \(3\), une racine ;
  • sur \([-1;1]\) : de \(3\) à \(-1\), une racine ;
  • sur \([1;+\infty[\) : de \(-1\) à \(+\infty\), une racine.

Par le corollaire du TVI appliqué à chaque branche : exactement trois solutions. \(\blacksquare\)

c) Évaluons :

\(x\) \(-2\) \(-1{,}5\) \(0\) \(0{,}5\) \(1{,}5\) \(2\)
\(f(x)\) \(-1\) \(2{,}125\) \(1\) \(-0{,}375\) \(-0{,}125\) \(3\)
  • Racine 1 dans \(]-2;-1{,}5[\) ;
  • Racine 2 dans \(]0;0{,}5[\) ;
  • Racine 3 dans \(]1{,}5;2[\).

(Valeurs exactes \(\approx -1{,}879\), \(0{,}347\), \(1{,}532\) ; ce sont \(2\cos\frac{2k\pi}{9}\) pour \(k=1,2,4\)… à un signe près.)

Corrigé — Exercice 8

Posons \(g(x) = f(x)e^{-x}\), dérivable comme produit.

\[ g'(x) = f'(x)e^{-x} - f(x)e^{-x} = e^{-x}\big(f'(x)-f(x)\big) = 0 \]

par hypothèse.

Une fonction de dérivée nulle sur l'intervalle \(\mathbb{R}\) est constante : \(g(x) = g(0) = f(0)e^0 = 1\).

Donc \(f(x)e^{-x}=1\), soit \(f(x)=e^x\). \(\blacksquare\)

Ce que ce résultat établit

L'exponentielle est l'unique solution de \(y'=y\) avec \(y(0)=1\). C'est d'ailleurs sa définition la plus économique, et c'est le prototype de toutes les équations différentielles linéaires.

La technique — multiplier par \(e^{-x}\) pour faire apparaître une dérivée nulle — s'appelle la méthode du facteur intégrant.

Corrigé — Exercice 9

a) \(f\) est continue sur \([a;b]\), dérivable sur \(]a;b[\), et \(f(a)=f(b)=0\). Le théorème de Rolle fournit \(c\in]a;b[\) avec \(f'(c)=0\). \(\blacksquare\)

b) Notons \(m = \frac{a+b}{2}\). On a \(f(a)=f(m)=f(b)=0\).

Rolle sur \([a;m]\) donne \(c_1\in]a;m[\) avec \(f'(c_1)=0\). Rolle sur \([m;b]\) donne \(c_2\in]m;b[\) avec \(f'(c_2)=0\).

Comme \(c_1 < m < c_2\), ces deux points sont distincts. Appliquons Rolle à \(f'\) sur \([c_1;c_2]\) — licite car \(f'\) est continue et dérivable (\(f\) est deux fois dérivable) et \(f'(c_1)=f'(c_2)=0\) :

il existe \(d\in]c_1;c_2[\subset]a;b[\) tel que \(f''(d)=0\). \(\blacksquare\)

c) Généralisation. Si \(f\) s'annule en \(n+1\) points distincts de \([a;b]\) et est \(n\) fois dérivable, alors \(f^{(n)}\) s'annule au moins une fois dans \(]a;b[\).

Démonstration par récurrence : \(f'\) s'annule en \(n\) points (Rolle entre chaque paire consécutive), \(f''\) en \(n-1\) points, …, \(f^{(n)}\) en 1 point. \(\blacksquare\)

Application

Un polynôme de degré \(n\) ayant \(n+1\) racines aurait sa dérivée \(n\)-ième — une constante non nulle — qui s'annulerait. Contradiction. C'est une preuve du fait qu'un polynôme non nul de degré \(n\) a au plus \(n\) racines.

Corrigé — Exercice 10

a) \(f(x)=x^2\), \(f'(x)=2x\). La récurrence est

\[ x_{n+1} = x_n - \eta\,2x_n = (1-2\eta)x_n \]

C'est une suite géométrique de raison \(q = 1-2\eta\) :

\[ x_n = (1-2\eta)^n x_0 \]

b) La suite converge vers 0 (le minimum) si et seulement si \(|q|<1\) :

\[ |1-2\eta| < 1 \iff -1 < 1-2\eta < 1 \iff 0 < \eta < 1 \]
  • Pour \(\eta > 1\) : \(|q|>1\), la suite diverge en oscillant.
  • Pour \(\eta = 1\) : \(q = -1\), la suite oscille entre \(x_0\) et \(-x_0\) sans converger.
  • Pour \(\eta \in\left]0;\frac12\right[\) : convergence monotone.
  • Pour \(\eta\in\left]\frac12;1\right[\) : convergence en oscillant.

c) La convergence est d'autant plus rapide que \(|q|\) est petit. Or \(q = 1-2\eta = 0\) pour

\[ \eta = \frac12 \]

Avec ce pas, \(x_1 = 0\) : convergence en une seule itération.

d) Pour \(f(x)=ax^2\), \(f'(x)=2ax\) et

\[ x_{n+1} = (1-2a\eta)x_n \]

Convergence pour \(0<\eta<\frac1a\), optimum en \(\eta = \frac{1}{2a}\).

Or \(f''(x) = 2a\). Le pas optimal est donc

\[ \eta^\star = \frac{1}{f''} \]

C'est la méthode de Newton

Le pas optimal de la descente de gradient est l'inverse de la dérivée seconde. Prendre \(\eta = \frac{1}{f''(x_n)}\) à chaque étape donne \(\displaystyle x_{n+1} = x_n - \frac{f'(x_n)}{f''(x_n)}\)

qui est exactement la méthode de Newton appliquée à \(f'\).

En dimension \(n\), \(f''\) devient la matrice hessienne, et le pas optimal fait intervenir son inverse. C'est le contenu du module OSCO23 en deuxième année : « calcul de gradient et de matrice hessienne […] méthode du gradient, méthode de Newton, quasi-Newton ».

Quand la hessienne est mal conditionnée — grand rapport entre la plus grande et la plus petite valeur propre — aucun pas scalaire ne convient dans toutes les directions, et la descente de gradient devient lente. C'est le lien avec la diagonalisation.

e) Vérification.

def descente(a, eta, x0, n):
    x = x0
    for _ in range(n):
        x = x - eta * 2 * a * x
    return x

# a = 1 : convergence pour 0 < eta < 1
assert abs(descente(1, 0.5, 10.0, 1)) < 1e-15      # 1 iteration
assert abs(descente(1, 0.1, 10.0, 100)) < 1e-9     # lent mais converge
assert abs(descente(1, 0.9, 10.0, 100)) < 1e-9     # oscille et converge
assert abs(descente(1, 1.5, 10.0, 50)) > 1e6       # diverge

# a = 5 : pas optimal 1/(2a) = 0.1
assert abs(descente(5, 0.1, 3.0, 1)) < 1e-15
print("OK")

Chapitre suivant : Fonctions usuelles.