10 · Couples et covariance¶
Intuition
Jusqu'ici, une variable à la fois. Mais les questions intéressantes portent presque toujours sur plusieurs grandeurs simultanément : taille et poids, température et consommation, deux actifs financiers.
La covariance mesure si deux variables varient dans le même sens. Positive : quand l'une monte, l'autre tend à monter. Négative : elles s'opposent. Nulle : aucune tendance linéaire — ce qui, comme on va le voir, ne veut pas dire indépendance.
1. Couples de variables¶
1.1 Cas discret¶
La loi conjointe de \((X,Y)\) est la donnée de
avec \(\sum_{i,j}p_{ij}=1\). On la présente dans un tableau à double entrée.
Lois marginales
On les obtient en sommant une ligne ou une colonne :
Ce sont les totaux en marge du tableau — d'où le nom.
Les marginales ne déterminent pas la conjointe
Deux lois conjointes très différentes peuvent avoir exactement les mêmes marginales. Connaître la loi de \(X\) et celle de \(Y\) séparément ne dit rien de leur relation.
C'est toute la difficulté de la modélisation multivariée — et la raison d'être des copules en finance.
Lois conditionnelles : \(P(Y=y_j\mid X=x_i) = \dfrac{p_{ij}}{P(X=x_i)}\).
1.2 Indépendance¶
Définition
\(X\) et \(Y\) sont indépendantes si pour tous \(i,j\) :
Autrement dit : la loi conjointe est le produit des marginales, ce qui se lit « chaque case du tableau est le produit de ses marges ».
Dans le cas continu : \(f_{(X,Y)}(x,y) = f_X(x)f_Y(y)\).
Il faut vérifier TOUTES les cases
Une seule case qui ne vérifie pas la relation suffit à réfuter l'indépendance. Pour la démontrer, il faut les vérifier toutes.
2. Covariance¶
Définition
La seconde écriture — analogue de König-Huygens — est toujours celle qu'on utilise en calcul.
Cas particulier : \(\operatorname{Cov}(X,X) = \operatorname{V}(X)\).
Propriétés
| Propriété | Énoncé |
|---|---|
| Symétrie | \(\operatorname{Cov}(X,Y)=\operatorname{Cov}(Y,X)\) |
| Bilinéarité | \(\operatorname{Cov}(aX+b,\ cY+d) = ac\operatorname{Cov}(X,Y)\) |
| Additivité | \(\operatorname{Cov}(X+Z,Y) = \operatorname{Cov}(X,Y)+\operatorname{Cov}(Z,Y)\) |
| Variance d'une somme | \(\operatorname{V}(X+Y) = \operatorname{V}X+\operatorname{V}Y+2\operatorname{Cov}(X,Y)\) |
Les constantes disparaissent : \(\operatorname{Cov}(X+b, Y) = \operatorname{Cov}(X,Y)\). Translater ne change pas la co-variation.
Le théorème central du chapitre
La réciproque est FAUSSE.
Démonstration du sens direct
Si \(X\) et \(Y\) sont indépendantes, alors \(\mathbb{E}[XY] = \mathbb{E}[X]\mathbb{E}[Y]\) (par sommation de la loi produit), donc la covariance est nulle. \(\blacksquare\)
Le contre-exemple à connaître
Soit \(X\) uniforme sur \(\{-1,0,1\}\) et \(Y=X^2\).
\(\mathbb{E}[X] = 0\) et \(\mathbb{E}[XY] = \mathbb{E}[X^3] = 0\) (par symétrie).
Pourtant \(Y\) est entièrement déterminée par \(X\) : elles sont aussi dépendantes qu'il est possible de l'être.
La covariance ne mesure que la dépendance LINÉAIRE. Une dépendance parfaitement fonctionnelle mais non monotone lui échappe complètement.
Deux variables de covariance nulle sont dites non corrélées.
3. Coefficient de corrélation¶
Définition
C'est la covariance normalisée : elle est sans unité et
Interprétation :
| \(\rho\) | Signification |
|---|---|
| \(+1\) | \(Y = aX+b\) avec \(a>0\) — dépendance affine croissante exacte |
| \(-1\) | \(Y = aX+b\) avec \(a<0\) |
| \(0\) | Aucune dépendance linéaire |
| \(\lvert\rho\rvert\) proche de 1 | Forte relation linéaire |
Pourquoi normaliser
La covariance dépend des unités : passer de mètres à centimètres la multiplie par 100. Le coefficient \(\rho\), lui, est invariant par changement d'échelle — c'est ce qui le rend comparable d'un jeu de données à l'autre.
Corrélation n'est pas causalité
Un \(\rho\) élevé entre deux variables peut résulter :
- d'une causalité \(X\to Y\) ;
- d'une causalité \(Y\to X\) ;
- d'une cause commune \(Z\) agissant sur les deux ;
- d'un biais de sélection ;
- du hasard (corrélation fallacieuse).
Rien dans le calcul de \(\rho\) ne permet de distinguer ces cas.
4. Variance d'une somme¶
Formule générale
Si les \(X_i\) sont deux à deux non corrélées, tous les termes croisés disparaissent :
La conséquence la plus importante du module
Pour \(n\) variables indépendantes de même variance \(\sigma^2\), la moyenne \(\overline X = \frac1n\sum X_i\) vérifie
La précision d'une moyenne croît en \(\sqrt n\). Pour diviser l'erreur par 2, il faut quadrupler l'échantillon.
C'est le résultat qui gouverne toute la statistique : taille des sondages, nombre de répétitions d'une simulation, budget d'une expérience.
Exemples traités¶
Exemple 1 — Tableau de loi conjointe
| \(X\backslash Y\) | 0 | 1 | Marge \(X\) |
|---|---|---|---|
| 0 | 0,2 | 0,3 | 0,5 |
| 1 | 0,1 | 0,4 | 0,5 |
| Marge \(Y\) | 0,3 | 0,7 | 1,0 |
Indépendance ? Testons la case \((0,0)\) :
\(0{,}2\neq0{,}15\) : non indépendantes.
Covariance. \(\mathbb{E}[X]=0{,}5\), \(\mathbb{E}[Y]=0{,}7\).
(seul le terme \(X=Y=1\) contribue.)
Corrélation. \(\operatorname{V}(X)=0{,}25\) donc \(\sigma_X=0{,}5\) ; \(\operatorname{V}(Y) = 0{,}7-0{,}49 = 0{,}21\) donc \(\sigma_Y\approx0{,}458\).
Corrélation positive faible.
Exemple 2 — Le contre-exemple, en détail
\(X\) uniforme sur \(\{-1,0,1\}\), \(Y=X^2\).
| \(X\) | \(-1\) | 0 | 1 |
|---|---|---|---|
| \(Y\) | 1 | 0 | 1 |
| \(P\) | \(\frac13\) | \(\frac13\) | \(\frac13\) |
\(\mathbb{E}[X] = 0\), \(\mathbb{E}[Y] = \frac23\). \(\mathbb{E}[XY] = \frac13(-1)(1)+\frac13(0)(0)+\frac13(1)(1) = 0\).
Mais indépendantes ? Testons :
\(\frac13\neq\frac19\) : non indépendantes — évidemment, puisque \(Y\) est une fonction de \(X\).
Exemple 3 — Variance de la moyenne
On mesure une grandeur avec un instrument d'écart-type \(\sigma=2\) mm. Combien de mesures pour ramener l'incertitude à 0,1 mm ?
400 mesures. Pour descendre à 0,05 mm, il en faudrait 1600.
Le rendement décroissant
Passer de 100 à 400 mesures divise l'erreur par 2. Passer de 400 à 1600 la divise encore par 2. Le coût de la précision croît quadratiquement.
C'est pourquoi, au-delà d'un certain point, il vaut mieux améliorer l'instrument (réduire \(\sigma\)) que multiplier les mesures.
Exemple 4 — Portefeuille
Deux actifs de rendements \(X\) et \(Y\), d'écarts-types \(\sigma_X=\sigma_Y= 10\%\), de corrélation \(\rho\). On investit à parts égales : \(R = \frac{X+Y}{2}\).
| \(\rho\) | \(\operatorname{V}(R)\) | \(\sigma(R)\) |
|---|---|---|
| \(+1\) | 100 | 10 % |
| \(0\) | 50 | 7,07 % |
| \(-1\) | 0 | 0 % |
La diversification ne réduit le risque que si \(\rho<1\). Avec deux actifs parfaitement anticorrélés, le risque disparaît entièrement.
C'est le fondement mathématique de la théorie moderne du portefeuille (Markowitz, 1952), et la raison pour laquelle les crises financières — où toutes les corrélations tendent vers 1 — sont si destructrices : la diversification cesse de fonctionner au pire moment.
Erreurs fréquentes¶
| Erreur | Correction |
|---|---|
| Covariance nulle \(\implies\) indépendance | Faux |
| Corrélation \(\implies\) causalité | Faux |
| \(\operatorname{V}(X+Y)=\operatorname{V}X+\operatorname{V}Y\) | Il manque \(2\operatorname{Cov}\) |
| \(\operatorname{V}(X-Y)=\operatorname{V}X-\operatorname{V}Y\) | C'est \(+\operatorname{V}Y-2\operatorname{Cov}\) |
| Marginales identiques \(\implies\) même conjointe | Faux |
| \(\sigma(\overline X) = \frac{\sigma}{n}\) | C'est \(\frac{\sigma}{\sqrt n}\) |
Exercices¶
★ Exercice 1. Soit le tableau :
| \(X\backslash Y\) | 1 | 2 |
|---|---|---|
| 0 | 0,1 | 0,2 |
| 1 | 0,3 | 0,4 |
a) Vérifier que c'est une loi. b) Déterminer les lois marginales. c) \(X\) et \(Y\) sont-elles indépendantes ?
★★ Exercice 2. Avec le tableau de l'exercice 1, calculer \(\mathbb{E}[X]\), \(\mathbb{E}[Y]\), \(\mathbb{E}[XY]\), \(\operatorname{Cov}(X,Y)\) et \(\rho\).
★★ Exercice 3. \(\operatorname{V}(X)=4\), \(\operatorname{V}(Y)=9\), \(\operatorname{Cov}(X,Y)=-3\).
a) Calculer \(\rho\). b) Calculer \(\operatorname{V}(X+Y)\) et \(\operatorname{V}(X-Y)\). c) Calculer \(\operatorname{V}(2X-3Y)\).
★★ Exercice 4. On lance deux dés. Soit \(S\) la somme et \(D\) la différence (premier moins second).
a) Calculer \(\mathbb{E}[S]\), \(\mathbb{E}[D]\), \(\mathbb{E}[SD]\). b) En déduire \(\operatorname{Cov}(S,D)\). c) \(S\) et \(D\) sont-elles indépendantes ? Justifier.
★★★ Exercice 5. Soient \(X\) et \(Y\) indépendantes de même variance \(\sigma^2\). On pose \(U=X+Y\) et \(V=X-Y\).
a) Calculer \(\operatorname{Cov}(U,V)\). b) \(U\) et \(V\) sont-elles indépendantes ? Discuter selon la loi de \(X\) et \(Y\).
★★★ Exercice 6. Démontrer l'inégalité de Cauchy-Schwarz :
Indication : considérez \(\operatorname{V}(X+tY) \geqslant 0\) comme trinôme en \(t\) et étudiez son discriminant.
En déduire \(|\rho|\leqslant1\), et caractériser le cas d'égalité.
★★★ Exercice 7. Un sondage porte sur \(n\) personnes. La proportion de « oui » dans la population est \(p\).
a) Loi et variance de la proportion observée \(\hat p\). b) Calculer \(\sigma(\hat p)\) pour \(p=0{,}5\) et \(n=1000\). c) Quelle taille \(n\) pour une marge d'erreur de \(\pm2\%\) à 95 % ? d) Pourquoi les instituts annoncent-ils toujours \(\pm3\%\) pour \(n=1000\) ?
★★★★ Exercice 8. Soit \((X_1,\dots,X_n)\) des variables échangeables (toutes de même loi, toutes les paires de même covariance \(c\)), de variance \(\sigma^2\).
a) Calculer \(\operatorname{V}(\overline X)\). b) Que se passe-t-il quand \(n\to+\infty\) ? c) Interpréter : que vaut la précision d'un sondage sur une population où les réponses sont corrélées ?
★★★★ Exercice 9 — lien informatique. L'estimation par Monte-Carlo approche \(I = \int_0^1 g(x)\,\mathrm{d}x\) par \(\hat I_n = \frac1n\sum_{i=1}^{n}g(U_i)\) avec \(U_i\) uniformes indépendantes.
a) Montrer que \(\mathbb{E}[\hat I_n] = I\) (l'estimateur est sans biais). b) Calculer \(\operatorname{V}(\hat I_n)\) et en déduire la vitesse de convergence. c) Comparer à la méthode des trapèzes en dimension 1, puis en dimension \(d\). d) Implémenter sur \(\int_0^1 e^{-x^2}\mathrm{d}x\) et vérifier la vitesse en \(\frac{1}{\sqrt n}\).
Corrigés¶
Corrigé — Exercice 1
a) \(0{,}1+0{,}2+0{,}3+0{,}4 = 1\) ✓
b) Marginales de \(X\) : \(P(X=0)=0{,}3\), \(P(X=1)=0{,}7\). Marginales de \(Y\) : \(P(Y=1)=0{,}4\), \(P(Y=2)=0{,}6\).
c) Test sur la case \((0,1)\) :
\(0{,}1\neq0{,}12\) : non indépendantes.
Corrigé — Exercice 2
\(\mathbb{E}[X] = 0{,}7\) ; \(\mathbb{E}[Y] = 1(0{,}4)+2(0{,}6) = 1{,}6\).
\(\operatorname{V}(X) = 0{,}7-0{,}49 = 0{,}21\), \(\sigma_X\approx0{,}458\). \(\mathbb{E}[Y^2] = 0{,}4+4(0{,}6) = 2{,}8\), donc \(\operatorname{V}(Y) = 2{,}8-2{,}56 = 0{,}24\), \(\sigma_Y\approx0{,}490\).
Corrélation négative très faible.
Corrigé — Exercice 3
a) \(\rho = \dfrac{-3}{2\times3} = -0{,}5\).
b)
Contrôle : la somme vaut \(26 = 2(4+9)\) — c'est l'identité du parallélogramme, analogue de celle du chapitre Analyse 10.
c) Par bilinéarité :
Corrigé — Exercice 4
Soit \(D_1, D_2\) les deux dés. \(S = D_1+D_2\), \(D = D_1-D_2\).
a) \(\mathbb{E}[S] = 7\) ; \(\mathbb{E}[D] = 0\) par symétrie.
(les deux dés ont la même loi.)
b) \(\operatorname{Cov}(S,D) = 0 - 7\times0 = 0\).
Non corrélées.
c) Non indépendantes. Contre-exemple :
Plus simplement : si \(S=2\), alors nécessairement \(D=0\). La connaissance de \(S\) contraint \(D\).
Un nouveau contre-exemple
\(S\) et \(D\) sont non corrélées mais dépendantes — et cette fois la dépendance n'est même pas fonctionnelle. C'est un exemple naturel, à opposer au contre-exemple artificiel \(Y=X^2\).
Remarque : \(S\) et \(D\) ont même parité, ce qui est une dépendance évidente que la covariance ne voit pas.
Corrigé — Exercice 5
a) Par bilinéarité :
\(U\) et \(V\) sont non corrélées ✓
b) Discussion.
- En général, elles ne sont PAS indépendantes. Prenons \(X,Y\) uniformes sur \(\{0,1\}\) : si \(U = X+Y = 0\), alors nécessairement \(X=Y=0\), donc \(V=0\). La connaissance de \(U\) détermine parfois \(V\).
- Si \(X\) et \(Y\) sont gaussiennes indépendantes, alors \(U\) et \(V\) sont indépendantes — c'est une propriété remarquable du cas gaussien, développée au chapitre 11.
L'exception gaussienne
C'est le seul cadre où « non corrélées » entraîne « indépendantes ». On y reviendra : c'est ce qui fait toute la commodité du monde gaussien.
Corrigé — Exercice 6
Pour tout \(t\in\mathbb{R}\), la variance est positive :
Supposons \(\operatorname{V}(Y)>0\) (sinon \(Y\) est constante et tout est trivial). Le membre de droite est un trinôme en \(t\) de coefficient dominant positif, qui reste \(\geqslant0\) pour tout \(t\).
Cela force son discriminant à être \(\leqslant0\) :
En prenant la racine :
Conséquence : \(|\rho| = \frac{|\operatorname{Cov}|}{\sigma_X\sigma_Y} \leqslant 1\).
Cas d'égalité. \(|\rho|=1\) signifie \(\Delta=0\), donc le trinôme a une racine double \(t_0\) pour laquelle
Une variance nulle signifie que \(X+t_0Y\) est presque sûrement constante :
\(|\rho|=1\) si et seulement si \(X\) et \(Y\) sont liées par une relation affine. Le signe de \(\rho\) est celui de la pente.
Corrigé — Exercice 7
a) Le nombre de « oui » suit \(\mathcal{B}(n,p)\), donc \(\hat p = \frac{X}{n}\) vérifie
b) Pour \(p=0{,}5\), \(n=1000\) :
1,58 point de pourcentage.
c) Marge à 95 % : \(1{,}96\,\sigma(\hat p) \leqslant 0{,}02\).
Environ 2400 personnes.
d) Pour \(n=1000\), la marge à 95 % vaut
Soit \(\pm3{,}1\) points — d'où l'annonce usuelle de \(\pm3\%\).
Le \(p=0{,}5\) est le pire cas
\(p(1-p)\) est maximal en \(p=\frac12\). Annoncer la marge calculée en \(p=0{,}5\) est donc une majoration valable quel que soit \(p\), ce qui justifie l'annonce unique.
Pour \(p=0{,}1\), la vraie marge à \(n=1000\) n'est que de \(1{,}96\sqrt{0{,}09/1000} = 1{,}9\) point.
Corrigé — Exercice 8
a)
Donc
b) Quand \(n\to+\infty\) :
La variance ne tend PAS vers 0 si \(c\neq0\) : elle plafonne à la covariance commune.
c) Interprétation. Si les réponses d'un sondage sont corrélées — parce que les personnes interrogées se sont parlé, appartiennent au même milieu, ou ont été recrutées par le même canal — alors augmenter la taille de l'échantillon ne réduit plus l'erreur au-delà d'un certain seuil.
La précision est plafonnée par \(\sqrt c\), quelle que soit la taille.
L'implication pratique
C'est pourquoi la méthode d'échantillonnage compte davantage que la taille. Un sondage de 1000 personnes correctement tirées au sort bat un sondage de 100 000 volontaires auto-sélectionnés sur Internet.
L'échec du sondage du Literary Digest en 1936 — 2,4 millions de réponses, prédiction totalement fausse — en est l'illustration historique.
Corrigé — Exercice 9
a) Sans biais. Par linéarité et transfert :
\(\blacksquare\)
b) Variance. Les \(U_i\) étant indépendantes :
L'erreur décroît en \(O(n^{-1/2})\), indépendamment de \(g\) et — c'est le point crucial — indépendamment de la dimension.
c) Comparaison.
| Méthode | Dimension 1 | Dimension \(d\) |
|---|---|---|
| Trapèzes | \(O(n^{-2})\) | \(O(n^{-2/d})\) |
| Simpson | \(O(n^{-4})\) | \(O(n^{-4/d})\) |
| Monte-Carlo | \(O(n^{-1/2})\) | \(O(n^{-1/2})\) |
En dimension 1, les trapèzes écrasent Monte-Carlo. Mais leur exposant est divisé par \(d\) : avec une grille régulière, atteindre une précision donnée en dimension \(d\) demande \(n^{1/d}\) points par axe.
Point de bascule : Monte-Carlo devient meilleur que les trapèzes dès que \(\frac2d < \frac12\), soit \(d>4\). Contre Simpson, dès \(d>8\).
C'est ce qui rend Monte-Carlo indispensable en finance (paniers de dizaines d'actifs), en physique statistique et en rendu d'images — des problèmes en dimension 10, 100 ou infinie.
d) Vérification.
import math
import random
def monte_carlo(g, n, rng):
return sum(g(rng.random()) for _ in range(n)) / n
g = lambda x: math.exp(-x * x)
exact = 0.746824132812427
for n in (100, 10_000, 1_000_000):
rng = random.Random(7)
approx = monte_carlo(g, n, rng)
print(f"n={n:>9} approx={approx:.6f} erreur={abs(approx-exact):.2e}")
Sortie :
n= 100 approx=0.767148 erreur=2.03e-02
n= 10000 approx=0.747780 erreur=9.55e-04
n= 1000000 approx=0.746846 erreur=2.22e-05
Vérification de la vitesse : entre \(n=100\) et \(n=10^4\), \(n\) est multiplié par 100 et l'erreur divisée par \(\approx21\) — à comparer à \(\sqrt{100}=10\).
Entre \(10^4\) et \(10^6\), elle est divisée par \(\approx43\), contre 10 attendus.
Les deux rapports encadrent la valeur théorique de façon très irrégulière : l'erreur Monte-Carlo est elle-même une variable aléatoire. Un seul tirage ne mesure pas une vitesse de convergence — il faudrait moyenner sur plusieurs graines. C'est exactement le genre de précaution que demande le module de modélisation.
La malédiction retournée
Monte-Carlo est lent mais sa lenteur ne dépend pas de la dimension. C'est le seul algorithme d'intégration dont on puisse dire cela, et c'est pourquoi il domine dès que \(d\) dépasse 4 ou 5.
Chapitre suivant : Vecteurs gaussiens.