Aller au contenu

10 · Couples et covariance

Intuition

Jusqu'ici, une variable à la fois. Mais les questions intéressantes portent presque toujours sur plusieurs grandeurs simultanément : taille et poids, température et consommation, deux actifs financiers.

La covariance mesure si deux variables varient dans le même sens. Positive : quand l'une monte, l'autre tend à monter. Négative : elles s'opposent. Nulle : aucune tendance linéaire — ce qui, comme on va le voir, ne veut pas dire indépendance.

1. Couples de variables

1.1 Cas discret

La loi conjointe de \((X,Y)\) est la donnée de

\[ p_{ij} = P(X=x_i,\ Y=y_j) \]

avec \(\sum_{i,j}p_{ij}=1\). On la présente dans un tableau à double entrée.

Lois marginales

On les obtient en sommant une ligne ou une colonne :

\[ P(X=x_i) = \sum_j p_{ij} \qquad P(Y=y_j) = \sum_i p_{ij} \]

Ce sont les totaux en marge du tableau — d'où le nom.

Les marginales ne déterminent pas la conjointe

Deux lois conjointes très différentes peuvent avoir exactement les mêmes marginales. Connaître la loi de \(X\) et celle de \(Y\) séparément ne dit rien de leur relation.

C'est toute la difficulté de la modélisation multivariée — et la raison d'être des copules en finance.

Lois conditionnelles : \(P(Y=y_j\mid X=x_i) = \dfrac{p_{ij}}{P(X=x_i)}\).

1.2 Indépendance

Définition

\(X\) et \(Y\) sont indépendantes si pour tous \(i,j\) :

\[ P(X=x_i,\ Y=y_j) = P(X=x_i)\,P(Y=y_j) \]

Autrement dit : la loi conjointe est le produit des marginales, ce qui se lit « chaque case du tableau est le produit de ses marges ».

Dans le cas continu : \(f_{(X,Y)}(x,y) = f_X(x)f_Y(y)\).

Il faut vérifier TOUTES les cases

Une seule case qui ne vérifie pas la relation suffit à réfuter l'indépendance. Pour la démontrer, il faut les vérifier toutes.

2. Covariance

Définition

\[ \operatorname{Cov}(X,Y) = \mathbb{E}\big[(X-\mathbb{E}X)(Y-\mathbb{E}Y)\big] = \mathbb{E}[XY]-\mathbb{E}[X]\mathbb{E}[Y] \]

La seconde écriture — analogue de König-Huygens — est toujours celle qu'on utilise en calcul.

Cas particulier : \(\operatorname{Cov}(X,X) = \operatorname{V}(X)\).

Propriétés

Propriété Énoncé
Symétrie \(\operatorname{Cov}(X,Y)=\operatorname{Cov}(Y,X)\)
Bilinéarité \(\operatorname{Cov}(aX+b,\ cY+d) = ac\operatorname{Cov}(X,Y)\)
Additivité \(\operatorname{Cov}(X+Z,Y) = \operatorname{Cov}(X,Y)+\operatorname{Cov}(Z,Y)\)
Variance d'une somme \(\operatorname{V}(X+Y) = \operatorname{V}X+\operatorname{V}Y+2\operatorname{Cov}(X,Y)\)

Les constantes disparaissent : \(\operatorname{Cov}(X+b, Y) = \operatorname{Cov}(X,Y)\). Translater ne change pas la co-variation.

Le théorème central du chapitre

\[ X, Y \text{ indépendantes} \implies \operatorname{Cov}(X,Y) = 0 \]

La réciproque est FAUSSE.

Démonstration du sens direct

Si \(X\) et \(Y\) sont indépendantes, alors \(\mathbb{E}[XY] = \mathbb{E}[X]\mathbb{E}[Y]\) (par sommation de la loi produit), donc la covariance est nulle. \(\blacksquare\)

Le contre-exemple à connaître

Soit \(X\) uniforme sur \(\{-1,0,1\}\) et \(Y=X^2\).

\(\mathbb{E}[X] = 0\) et \(\mathbb{E}[XY] = \mathbb{E}[X^3] = 0\) (par symétrie).

\[ \operatorname{Cov}(X,Y) = 0-0\times\mathbb{E}[Y] = 0 \]

Pourtant \(Y\) est entièrement déterminée par \(X\) : elles sont aussi dépendantes qu'il est possible de l'être.

La covariance ne mesure que la dépendance LINÉAIRE. Une dépendance parfaitement fonctionnelle mais non monotone lui échappe complètement.

Deux variables de covariance nulle sont dites non corrélées.

3. Coefficient de corrélation

Définition

\[ \rho(X,Y) = \frac{\operatorname{Cov}(X,Y)}{\sigma(X)\,\sigma(Y)} \]

C'est la covariance normalisée : elle est sans unité et

\[ -1 \leqslant \rho \leqslant 1 \]

Interprétation :

\(\rho\) Signification
\(+1\) \(Y = aX+b\) avec \(a>0\) — dépendance affine croissante exacte
\(-1\) \(Y = aX+b\) avec \(a<0\)
\(0\) Aucune dépendance linéaire
\(\lvert\rho\rvert\) proche de 1 Forte relation linéaire

Pourquoi normaliser

La covariance dépend des unités : passer de mètres à centimètres la multiplie par 100. Le coefficient \(\rho\), lui, est invariant par changement d'échelle — c'est ce qui le rend comparable d'un jeu de données à l'autre.

Corrélation n'est pas causalité

Un \(\rho\) élevé entre deux variables peut résulter :

  • d'une causalité \(X\to Y\) ;
  • d'une causalité \(Y\to X\) ;
  • d'une cause commune \(Z\) agissant sur les deux ;
  • d'un biais de sélection ;
  • du hasard (corrélation fallacieuse).

Rien dans le calcul de \(\rho\) ne permet de distinguer ces cas.

4. Variance d'une somme

Formule générale

\[ \operatorname{V}\!\left(\sum_{i=1}^{n}X_i\right) = \sum_{i=1}^{n}\operatorname{V}(X_i) + 2\sum_{i<j}\operatorname{Cov}(X_i,X_j) \]

Si les \(X_i\) sont deux à deux non corrélées, tous les termes croisés disparaissent :

\[ \operatorname{V}\!\left(\sum X_i\right) = \sum\operatorname{V}(X_i) \]

La conséquence la plus importante du module

Pour \(n\) variables indépendantes de même variance \(\sigma^2\), la moyenne \(\overline X = \frac1n\sum X_i\) vérifie

\[ \operatorname{V}(\overline X) = \frac{1}{n^2}\times n\sigma^2 = \frac{\sigma^2}{n} \qquad \sigma(\overline X) = \frac{\sigma}{\sqrt n} \]

La précision d'une moyenne croît en \(\sqrt n\). Pour diviser l'erreur par 2, il faut quadrupler l'échantillon.

C'est le résultat qui gouverne toute la statistique : taille des sondages, nombre de répétitions d'une simulation, budget d'une expérience.

Exemples traités

Exemple 1 — Tableau de loi conjointe

\(X\backslash Y\) 0 1 Marge \(X\)
0 0,2 0,3 0,5
1 0,1 0,4 0,5
Marge \(Y\) 0,3 0,7 1,0

Indépendance ? Testons la case \((0,0)\) :

\[ P(X=0,Y=0) = 0{,}2 \qquad P(X=0)P(Y=0) = 0{,}5\times0{,}3 = 0{,}15 \]

\(0{,}2\neq0{,}15\) : non indépendantes.

Covariance. \(\mathbb{E}[X]=0{,}5\), \(\mathbb{E}[Y]=0{,}7\).

\[ \mathbb{E}[XY] = 1\times1\times0{,}4 = 0{,}4 \]

(seul le terme \(X=Y=1\) contribue.)

\[ \operatorname{Cov}(X,Y) = 0{,}4-0{,}35 = 0{,}05 \]

Corrélation. \(\operatorname{V}(X)=0{,}25\) donc \(\sigma_X=0{,}5\) ; \(\operatorname{V}(Y) = 0{,}7-0{,}49 = 0{,}21\) donc \(\sigma_Y\approx0{,}458\).

\[ \rho = \frac{0{,}05}{0{,}5\times0{,}458} \approx 0{,}218 \]

Corrélation positive faible.

Exemple 2 — Le contre-exemple, en détail

\(X\) uniforme sur \(\{-1,0,1\}\), \(Y=X^2\).

\(X\) \(-1\) 0 1
\(Y\) 1 0 1
\(P\) \(\frac13\) \(\frac13\) \(\frac13\)

\(\mathbb{E}[X] = 0\), \(\mathbb{E}[Y] = \frac23\). \(\mathbb{E}[XY] = \frac13(-1)(1)+\frac13(0)(0)+\frac13(1)(1) = 0\).

\[ \operatorname{Cov}(X,Y) = 0-0\times\frac23 = 0 \]

Mais indépendantes ? Testons :

\[ P(X=0, Y=0) = \frac13 \qquad P(X=0)P(Y=0) = \frac13\times\frac13 = \frac19 \]

\(\frac13\neq\frac19\) : non indépendantes — évidemment, puisque \(Y\) est une fonction de \(X\).

Exemple 3 — Variance de la moyenne

On mesure une grandeur avec un instrument d'écart-type \(\sigma=2\) mm. Combien de mesures pour ramener l'incertitude à 0,1 mm ?

\[ \frac{\sigma}{\sqrt n} \leqslant 0{,}1 \iff \sqrt n \geqslant 20 \iff n \geqslant 400 \]

400 mesures. Pour descendre à 0,05 mm, il en faudrait 1600.

Le rendement décroissant

Passer de 100 à 400 mesures divise l'erreur par 2. Passer de 400 à 1600 la divise encore par 2. Le coût de la précision croît quadratiquement.

C'est pourquoi, au-delà d'un certain point, il vaut mieux améliorer l'instrument (réduire \(\sigma\)) que multiplier les mesures.

Exemple 4 — Portefeuille

Deux actifs de rendements \(X\) et \(Y\), d'écarts-types \(\sigma_X=\sigma_Y= 10\%\), de corrélation \(\rho\). On investit à parts égales : \(R = \frac{X+Y}{2}\).

\[ \operatorname{V}(R) = \frac14\big(\sigma_X^2+\sigma_Y^2+2\rho\sigma_X\sigma_Y\big) = \frac{100(2+2\rho)}{4} = 50(1+\rho) \]
\(\rho\) \(\operatorname{V}(R)\) \(\sigma(R)\)
\(+1\) 100 10 %
\(0\) 50 7,07 %
\(-1\) 0 0 %

La diversification ne réduit le risque que si \(\rho<1\). Avec deux actifs parfaitement anticorrélés, le risque disparaît entièrement.

C'est le fondement mathématique de la théorie moderne du portefeuille (Markowitz, 1952), et la raison pour laquelle les crises financières — où toutes les corrélations tendent vers 1 — sont si destructrices : la diversification cesse de fonctionner au pire moment.

Erreurs fréquentes

Erreur Correction
Covariance nulle \(\implies\) indépendance Faux
Corrélation \(\implies\) causalité Faux
\(\operatorname{V}(X+Y)=\operatorname{V}X+\operatorname{V}Y\) Il manque \(2\operatorname{Cov}\)
\(\operatorname{V}(X-Y)=\operatorname{V}X-\operatorname{V}Y\) C'est \(+\operatorname{V}Y-2\operatorname{Cov}\)
Marginales identiques \(\implies\) même conjointe Faux
\(\sigma(\overline X) = \frac{\sigma}{n}\) C'est \(\frac{\sigma}{\sqrt n}\)

Exercices

★ Exercice 1. Soit le tableau :

\(X\backslash Y\) 1 2
0 0,1 0,2
1 0,3 0,4

a) Vérifier que c'est une loi. b) Déterminer les lois marginales. c) \(X\) et \(Y\) sont-elles indépendantes ?

★★ Exercice 2. Avec le tableau de l'exercice 1, calculer \(\mathbb{E}[X]\), \(\mathbb{E}[Y]\), \(\mathbb{E}[XY]\), \(\operatorname{Cov}(X,Y)\) et \(\rho\).

★★ Exercice 3. \(\operatorname{V}(X)=4\), \(\operatorname{V}(Y)=9\), \(\operatorname{Cov}(X,Y)=-3\).

a) Calculer \(\rho\). b) Calculer \(\operatorname{V}(X+Y)\) et \(\operatorname{V}(X-Y)\). c) Calculer \(\operatorname{V}(2X-3Y)\).

★★ Exercice 4. On lance deux dés. Soit \(S\) la somme et \(D\) la différence (premier moins second).

a) Calculer \(\mathbb{E}[S]\), \(\mathbb{E}[D]\), \(\mathbb{E}[SD]\). b) En déduire \(\operatorname{Cov}(S,D)\). c) \(S\) et \(D\) sont-elles indépendantes ? Justifier.

★★★ Exercice 5. Soient \(X\) et \(Y\) indépendantes de même variance \(\sigma^2\). On pose \(U=X+Y\) et \(V=X-Y\).

a) Calculer \(\operatorname{Cov}(U,V)\). b) \(U\) et \(V\) sont-elles indépendantes ? Discuter selon la loi de \(X\) et \(Y\).

★★★ Exercice 6. Démontrer l'inégalité de Cauchy-Schwarz :

\[ \big|\operatorname{Cov}(X,Y)\big| \leqslant \sigma(X)\,\sigma(Y) \]

Indication : considérez \(\operatorname{V}(X+tY) \geqslant 0\) comme trinôme en \(t\) et étudiez son discriminant.

En déduire \(|\rho|\leqslant1\), et caractériser le cas d'égalité.

★★★ Exercice 7. Un sondage porte sur \(n\) personnes. La proportion de « oui » dans la population est \(p\).

a) Loi et variance de la proportion observée \(\hat p\). b) Calculer \(\sigma(\hat p)\) pour \(p=0{,}5\) et \(n=1000\). c) Quelle taille \(n\) pour une marge d'erreur de \(\pm2\%\) à 95 % ? d) Pourquoi les instituts annoncent-ils toujours \(\pm3\%\) pour \(n=1000\) ?

★★★★ Exercice 8. Soit \((X_1,\dots,X_n)\) des variables échangeables (toutes de même loi, toutes les paires de même covariance \(c\)), de variance \(\sigma^2\).

a) Calculer \(\operatorname{V}(\overline X)\). b) Que se passe-t-il quand \(n\to+\infty\) ? c) Interpréter : que vaut la précision d'un sondage sur une population où les réponses sont corrélées ?

★★★★ Exercice 9 — lien informatique. L'estimation par Monte-Carlo approche \(I = \int_0^1 g(x)\,\mathrm{d}x\) par \(\hat I_n = \frac1n\sum_{i=1}^{n}g(U_i)\) avec \(U_i\) uniformes indépendantes.

a) Montrer que \(\mathbb{E}[\hat I_n] = I\) (l'estimateur est sans biais). b) Calculer \(\operatorname{V}(\hat I_n)\) et en déduire la vitesse de convergence. c) Comparer à la méthode des trapèzes en dimension 1, puis en dimension \(d\). d) Implémenter sur \(\int_0^1 e^{-x^2}\mathrm{d}x\) et vérifier la vitesse en \(\frac{1}{\sqrt n}\).


Corrigés

Corrigé — Exercice 1

a) \(0{,}1+0{,}2+0{,}3+0{,}4 = 1\) ✓

b) Marginales de \(X\) : \(P(X=0)=0{,}3\), \(P(X=1)=0{,}7\). Marginales de \(Y\) : \(P(Y=1)=0{,}4\), \(P(Y=2)=0{,}6\).

c) Test sur la case \((0,1)\) :

\[ P(X=0,Y=1) = 0{,}1 \qquad P(X=0)P(Y=1) = 0{,}3\times0{,}4 = 0{,}12 \]

\(0{,}1\neq0{,}12\) : non indépendantes.

Corrigé — Exercice 2

\(\mathbb{E}[X] = 0{,}7\) ; \(\mathbb{E}[Y] = 1(0{,}4)+2(0{,}6) = 1{,}6\).

\[ \mathbb{E}[XY] = 0 + 1\times1\times0{,}3 + 1\times2\times0{,}4 = 1{,}1 \]
\[ \operatorname{Cov}(X,Y) = 1{,}1 - 0{,}7\times1{,}6 = 1{,}1-1{,}12 = -0{,}02 \]

\(\operatorname{V}(X) = 0{,}7-0{,}49 = 0{,}21\), \(\sigma_X\approx0{,}458\). \(\mathbb{E}[Y^2] = 0{,}4+4(0{,}6) = 2{,}8\), donc \(\operatorname{V}(Y) = 2{,}8-2{,}56 = 0{,}24\), \(\sigma_Y\approx0{,}490\).

\[ \rho = \frac{-0{,}02}{0{,}458\times0{,}490} \approx -0{,}089 \]

Corrélation négative très faible.

Corrigé — Exercice 3

a) \(\rho = \dfrac{-3}{2\times3} = -0{,}5\).

b)

\[ \operatorname{V}(X+Y) = 4+9+2(-3) = 7 \]
\[ \operatorname{V}(X-Y) = 4+9-2(-3) = 19 \]

Contrôle : la somme vaut \(26 = 2(4+9)\) — c'est l'identité du parallélogramme, analogue de celle du chapitre Analyse 10.

c) Par bilinéarité :

\[ \operatorname{V}(2X-3Y) = 4\operatorname{V}(X)+9\operatorname{V}(Y)-12\operatorname{Cov}(X,Y) \]
\[ = 16+81-12(-3) = 16+81+36 = 133 \]
Corrigé — Exercice 4

Soit \(D_1, D_2\) les deux dés. \(S = D_1+D_2\), \(D = D_1-D_2\).

a) \(\mathbb{E}[S] = 7\) ; \(\mathbb{E}[D] = 0\) par symétrie.

\[ \mathbb{E}[SD] = \mathbb{E}[(D_1+D_2)(D_1-D_2)] = \mathbb{E}[D_1^2]-\mathbb{E}[D_2^2] = 0 \]

(les deux dés ont la même loi.)

b) \(\operatorname{Cov}(S,D) = 0 - 7\times0 = 0\).

Non corrélées.

c) Non indépendantes. Contre-exemple :

\[ P(S=2) = \frac{1}{36} \quad\text{(le couple }(1,1)) \]
\[ P(S=2, D=0) = \frac1{36} \neq P(S=2)P(D=0) = \frac1{36}\times\frac{6}{36} \]

Plus simplement : si \(S=2\), alors nécessairement \(D=0\). La connaissance de \(S\) contraint \(D\).

Un nouveau contre-exemple

\(S\) et \(D\) sont non corrélées mais dépendantes — et cette fois la dépendance n'est même pas fonctionnelle. C'est un exemple naturel, à opposer au contre-exemple artificiel \(Y=X^2\).

Remarque : \(S\) et \(D\) ont même parité, ce qui est une dépendance évidente que la covariance ne voit pas.

Corrigé — Exercice 5

a) Par bilinéarité :

\[ \operatorname{Cov}(X+Y,\ X-Y) = \operatorname{V}(X)-\operatorname{Cov}(X,Y) +\operatorname{Cov}(Y,X)-\operatorname{V}(Y) \]
\[ = \operatorname{V}(X)-\operatorname{V}(Y) = \sigma^2-\sigma^2 = 0 \]

\(U\) et \(V\) sont non corrélées ✓

b) Discussion.

  • En général, elles ne sont PAS indépendantes. Prenons \(X,Y\) uniformes sur \(\{0,1\}\) : si \(U = X+Y = 0\), alors nécessairement \(X=Y=0\), donc \(V=0\). La connaissance de \(U\) détermine parfois \(V\).
  • Si \(X\) et \(Y\) sont gaussiennes indépendantes, alors \(U\) et \(V\) sont indépendantes — c'est une propriété remarquable du cas gaussien, développée au chapitre 11.

L'exception gaussienne

C'est le seul cadre où « non corrélées » entraîne « indépendantes ». On y reviendra : c'est ce qui fait toute la commodité du monde gaussien.

Corrigé — Exercice 6

Pour tout \(t\in\mathbb{R}\), la variance est positive :

\[ 0 \leqslant \operatorname{V}(X+tY) = \operatorname{V}(X)+2t\operatorname{Cov}(X,Y)+t^2\operatorname{V}(Y) \]

Supposons \(\operatorname{V}(Y)>0\) (sinon \(Y\) est constante et tout est trivial). Le membre de droite est un trinôme en \(t\) de coefficient dominant positif, qui reste \(\geqslant0\) pour tout \(t\).

Cela force son discriminant à être \(\leqslant0\) :

\[ \Delta = 4\operatorname{Cov}(X,Y)^2 - 4\operatorname{V}(X)\operatorname{V}(Y) \leqslant 0 \]
\[ \operatorname{Cov}(X,Y)^2 \leqslant \operatorname{V}(X)\operatorname{V}(Y) \]

En prenant la racine :

\[ |\operatorname{Cov}(X,Y)| \leqslant \sigma(X)\sigma(Y) \quad\blacksquare \]

Conséquence : \(|\rho| = \frac{|\operatorname{Cov}|}{\sigma_X\sigma_Y} \leqslant 1\).

Cas d'égalité. \(|\rho|=1\) signifie \(\Delta=0\), donc le trinôme a une racine double \(t_0\) pour laquelle

\[ \operatorname{V}(X+t_0Y) = 0 \]

Une variance nulle signifie que \(X+t_0Y\) est presque sûrement constante :

\[ X = -t_0 Y + c \]

\(|\rho|=1\) si et seulement si \(X\) et \(Y\) sont liées par une relation affine. Le signe de \(\rho\) est celui de la pente.

Corrigé — Exercice 7

a) Le nombre de « oui » suit \(\mathcal{B}(n,p)\), donc \(\hat p = \frac{X}{n}\) vérifie

\[ \mathbb{E}[\hat p] = p \qquad \operatorname{V}(\hat p) = \frac{np(1-p)}{n^2} = \frac{p(1-p)}{n} \]

b) Pour \(p=0{,}5\), \(n=1000\) :

\[ \sigma(\hat p) = \sqrt{\frac{0{,}25}{1000}} = \sqrt{2{,}5\times10^{-4}} = 0{,}0158 \]

1,58 point de pourcentage.

c) Marge à 95 % : \(1{,}96\,\sigma(\hat p) \leqslant 0{,}02\).

\[ 1{,}96\sqrt{\frac{0{,}25}{n}} \leqslant 0{,}02 \implies \frac{0{,}25}{n} \leqslant \left(\frac{0{,}02}{1{,}96}\right)^2 \]
\[ n \geqslant \frac{0{,}25\times1{,}96^2}{0{,}0004} = \frac{0{,}9604}{0{,}0004} = 2401 \]

Environ 2400 personnes.

d) Pour \(n=1000\), la marge à 95 % vaut

\[ 1{,}96\times0{,}0158 \approx 0{,}031 \]

Soit \(\pm3{,}1\) points — d'où l'annonce usuelle de \(\pm3\%\).

Le \(p=0{,}5\) est le pire cas

\(p(1-p)\) est maximal en \(p=\frac12\). Annoncer la marge calculée en \(p=0{,}5\) est donc une majoration valable quel que soit \(p\), ce qui justifie l'annonce unique.

Pour \(p=0{,}1\), la vraie marge à \(n=1000\) n'est que de \(1{,}96\sqrt{0{,}09/1000} = 1{,}9\) point.

Corrigé — Exercice 8

a)

\[ \operatorname{V}\!\left(\sum_{i=1}^{n}X_i\right) = n\sigma^2 + 2\binom n2 c = n\sigma^2+n(n-1)c \]

Donc

\[ \operatorname{V}(\overline X) = \frac{n\sigma^2+n(n-1)c}{n^2} = \frac{\sigma^2}{n}+\frac{(n-1)c}{n} \]

b) Quand \(n\to+\infty\) :

\[ \operatorname{V}(\overline X) \longrightarrow c \]

La variance ne tend PAS vers 0 si \(c\neq0\) : elle plafonne à la covariance commune.

c) Interprétation. Si les réponses d'un sondage sont corrélées — parce que les personnes interrogées se sont parlé, appartiennent au même milieu, ou ont été recrutées par le même canal — alors augmenter la taille de l'échantillon ne réduit plus l'erreur au-delà d'un certain seuil.

La précision est plafonnée par \(\sqrt c\), quelle que soit la taille.

L'implication pratique

C'est pourquoi la méthode d'échantillonnage compte davantage que la taille. Un sondage de 1000 personnes correctement tirées au sort bat un sondage de 100 000 volontaires auto-sélectionnés sur Internet.

L'échec du sondage du Literary Digest en 1936 — 2,4 millions de réponses, prédiction totalement fausse — en est l'illustration historique.

Corrigé — Exercice 9

a) Sans biais. Par linéarité et transfert :

\[ \mathbb{E}[\hat I_n] = \frac1n\sum_{i=1}^{n}\mathbb{E}[g(U_i)] = \mathbb{E}[g(U)] = \int_0^1 g(x)\cdot1\,\mathrm{d}x = I \]

\(\blacksquare\)

b) Variance. Les \(U_i\) étant indépendantes :

\[ \operatorname{V}(\hat I_n) = \frac{1}{n^2}\times n\operatorname{V}(g(U)) = \frac{\operatorname{V}(g(U))}{n} \]
\[ \sigma(\hat I_n) = \frac{\sigma_g}{\sqrt n} \]

L'erreur décroît en \(O(n^{-1/2})\), indépendamment de \(g\) et — c'est le point crucial — indépendamment de la dimension.

c) Comparaison.

Méthode Dimension 1 Dimension \(d\)
Trapèzes \(O(n^{-2})\) \(O(n^{-2/d})\)
Simpson \(O(n^{-4})\) \(O(n^{-4/d})\)
Monte-Carlo \(O(n^{-1/2})\) \(O(n^{-1/2})\)

En dimension 1, les trapèzes écrasent Monte-Carlo. Mais leur exposant est divisé par \(d\) : avec une grille régulière, atteindre une précision donnée en dimension \(d\) demande \(n^{1/d}\) points par axe.

Point de bascule : Monte-Carlo devient meilleur que les trapèzes dès que \(\frac2d < \frac12\), soit \(d>4\). Contre Simpson, dès \(d>8\).

C'est ce qui rend Monte-Carlo indispensable en finance (paniers de dizaines d'actifs), en physique statistique et en rendu d'images — des problèmes en dimension 10, 100 ou infinie.

d) Vérification.

import math
import random

def monte_carlo(g, n, rng):
    return sum(g(rng.random()) for _ in range(n)) / n

g = lambda x: math.exp(-x * x)
exact = 0.746824132812427

for n in (100, 10_000, 1_000_000):
    rng = random.Random(7)
    approx = monte_carlo(g, n, rng)
    print(f"n={n:>9}  approx={approx:.6f}  erreur={abs(approx-exact):.2e}")

Sortie :

n=      100  approx=0.767148  erreur=2.03e-02
n=    10000  approx=0.747780  erreur=9.55e-04
n=  1000000  approx=0.746846  erreur=2.22e-05

Vérification de la vitesse : entre \(n=100\) et \(n=10^4\), \(n\) est multiplié par 100 et l'erreur divisée par \(\approx21\) — à comparer à \(\sqrt{100}=10\).

Entre \(10^4\) et \(10^6\), elle est divisée par \(\approx43\), contre 10 attendus.

Les deux rapports encadrent la valeur théorique de façon très irrégulière : l'erreur Monte-Carlo est elle-même une variable aléatoire. Un seul tirage ne mesure pas une vitesse de convergence — il faudrait moyenner sur plusieurs graines. C'est exactement le genre de précaution que demande le module de modélisation.

La malédiction retournée

Monte-Carlo est lent mais sa lenteur ne dépend pas de la dimension. C'est le seul algorithme d'intégration dont on puisse dire cela, et c'est pourquoi il domine dès que \(d\) dépasse 4 ou 5.


Chapitre suivant : Vecteurs gaussiens.