12 · Théorèmes limites¶
Intuition
Deux théorèmes closent le module, et ils répondent à deux questions différentes sur la moyenne empirique \(\overline X_n = \frac1n\sum X_i\).
- Vers quoi tend-elle ? → la loi des grands nombres : vers l'espérance \(\mu\). C'est ce qui justifie qu'une fréquence observée approche une probabilité.
- À quelle vitesse, et avec quelle forme d'erreur ? → le théorème central limite : l'écart est de l'ordre de \(\frac{\sigma}{\sqrt n}\), et il est gaussien, quelle que soit la loi de départ.
Le second est le résultat le plus remarquable du calcul des probabilités : la loi normale émerge de n'importe quelle loi initiale, pourvu qu'on somme assez de termes indépendants.
1. Loi des grands nombres¶
Loi faible des grands nombres
Soient \(X_1,X_2,\dots\) indépendantes, de même loi, d'espérance \(\mu\) et de variance \(\sigma^2\) finie. Alors pour tout \(\varepsilon>0\) :
Démonstration
Par les résultats du chapitre 10 :
L'inégalité de Bienaymé-Tchebychev (exercice 9 du chapitre 06) donne
\(\blacksquare\)
Trois lignes. C'est l'un des théorèmes majeurs des probabilités, et sa démonstration tient dans une inégalité élémentaire.
Loi forte
Il existe une version plus puissante — la loi forte — affirmant que \(\overline X_n \to \mu\) presque sûrement : pour presque toute réalisation, la suite des moyennes converge. Elle est hors programme du S1, sa démonstration étant nettement plus difficile.
L'interprétation fréquentiste
Appliquons la loi des grands nombres aux indicatrices d'un événement \(A\) : \(X_i = \mathbf{1}_{A}\) à la \(i\)-ème répétition, d'espérance \(\mu = P(A)\).
Alors \(\overline X_n\) est la fréquence observée de \(A\), et
C'est ce qui relie la théorie à l'observation. Sans ce théorème, la probabilité resterait un objet formel sans lien avec les expériences.
Ce que la loi des grands nombres ne dit PAS
Elle ne dit pas que les écarts se compensent. Si l'on obtient 60 piles en 100 lancers, la nature ne « compensera » pas par des faces supplémentaires : l'écart absolu \(|S_n - \frac n2|\) tend même vers l'infini.
Ce qui tend vers 0 est l'écart relatif : \(\frac{60}{100}=0{,}6\) devient négligeable devant 0,5 quand \(n\) grandit, parce que les 10 piles excédentaires se diluent, pas parce qu'ils sont annulés.
C'est la réfutation exacte du sophisme du joueur.
2. Théorème central limite¶
Théorème central limite (TCL)
Soient \(X_1,X_2,\dots\) indépendantes, de même loi, d'espérance \(\mu\) et de variance \(\sigma^2\) finie et non nulle. Alors
De façon équivalente, avec \(S_n = \sum_{i=1}^{n}X_i\) :
Traduction pratique : pour \(n\) assez grand,
Pourquoi c'est extraordinaire
La loi des \(X_i\) n'intervient nulle part dans la conclusion. Qu'ils soient de Bernoulli, uniformes, exponentiels ou d'une loi bizarre, la somme normalisée converge vers la même loi normale.
Seules comptent \(\mu\) et \(\sigma^2\). Toute l'information de forme est effacée par la sommation.
C'est pourquoi la loi normale apparaît partout où une grandeur résulte de l'accumulation de nombreuses petites contributions indépendantes.
Les hypothèses comptent
- Variance finie : la loi de Cauchy n'a pas de variance, et sa moyenne empirique ne converge pas — elle suit la même loi de Cauchy quel que soit \(n\).
- Indépendance : sans elle, la variance de la somme fait intervenir des covariances et la conclusion tombe.
- Même loi : il existe des versions généralisées (Lindeberg, Lyapounov), mais elles exigent que chaque terme soit négligeable devant la somme.
Règle pratique : \(n\geqslant30\) suffit en général. Pour une loi très asymétrique, il en faut davantage ; pour une loi symétrique, \(n=10\) peut suffire.
3. Applications¶
3.1 Approximation de la binomiale¶
Approximation normale
Si \(X\sim\mathcal{B}(n,p)\) avec \(np\geqslant5\) et \(n(1-p)\geqslant5\) :
C'est le TCL appliqué à une somme de Bernoulli.
Correction de continuité
On approche une loi discrète par une loi continue. Pour améliorer la précision, on élargit d'une demi-unité :
Sans cette correction, l'erreur peut atteindre plusieurs points de pourcentage.
3.2 Intervalle de confiance¶
Intervalle de confiance à 95 % pour une moyenne
D'après le TCL, avec probabilité \(\approx0{,}95\) :
Pour une proportion, \(\sigma^2 = p(1-p)\leqslant\frac14\), d'où l'intervalle conservateur
Marge d'erreur usuelle : \(\frac{1}{\sqrt n}\) en ordre de grandeur. Pour \(n=1000\), environ \(\pm3\%\) — le chiffre annoncé par tous les instituts de sondage.
Ce que ce chapitre ouvre
L'estimation, les intervalles de confiance et les tests statistiques sont l'objet du module STAT12 au deuxième semestre. Le TCL en est le fondement unique : sans lui, aucune inférence statistique ne serait possible.
Exemples traités¶
Exemple 1 — Loi des grands nombres, quantifiée
On lance une pièce équilibrée \(n\) fois. Quelle est la probabilité que la fréquence de piles s'écarte de 0,5 de plus de 0,01 ?
Ici \(\mu = 0{,}5\), \(\sigma^2 = 0{,}25\).
Par Tchebychev :
Pour \(n=10^6\) : majoration par \(0{,}0025\).
Par le TCL — bien plus précis :
Tchebychev majore par \(2{,}5\times10^{-3}\), le TCL donne \(10^{-89}\).
L'écart de 86 ordres de grandeur illustre à quel point Tchebychev est grossier — mais c'est le prix de son universalité : il ne suppose rien sur la loi.
Exemple 2 — Approximation binomiale
\(X\sim\mathcal{B}(100\,;0{,}5)\). Calculer \(P(X\leqslant45)\).
Conditions : \(np = 50\geqslant5\) et \(n(1-p)=50\geqslant5\) ✓
\(\mu = 50\), \(\sigma = \sqrt{25} = 5\).
Avec correction de continuité :
Sans correction : \(z=-1\) donnerait \(0{,}1587\).
Valeur exacte : \(0{,}1841\).
La correction de continuité fait passer l'erreur de 16 % à 0,02 %.
Exemple 3 — Somme de variables quelconques
On additionne 100 nombres tirés uniformément sur \([0;1]\), indépendamment. Quelle est la probabilité que la somme dépasse 55 ?
Pour \(\mathcal{U}([0;1])\) : \(\mu = 0{,}5\), \(\sigma^2 = \frac{1}{12}\).
Par le TCL, \(S_{100}\approx\mathcal{N}\!\left(50,\ \frac{100}{12}\right)\), donc \(\sigma_S = \sqrt{8{,}333}\approx2{,}887\).
Environ 4,2 % — et l'on n'a jamais eu besoin de la loi de \(S_{100}\), qui est une fonction polynomiale par morceaux de degré 99 parfaitement inutilisable.
Exemple 4 — Dimensionner un sondage
On veut estimer une proportion inconnue \(p\) avec une marge de \(\pm1\%\) au niveau de confiance 95 %. Combien de personnes interroger ?
Environ 9600 personnes.
Pour \(\pm2\%\), il en faudrait 2401 ; pour \(\pm3\%\), 1068. Diviser la marge par 3 multiplie le coût par 9.
Erreurs fréquentes¶
| Erreur | Correction |
|---|---|
| « Les écarts se compensent » | Seul l'écart relatif tend vers 0 |
| Appliquer le TCL sans variance finie | Cauchy : le TCL ne s'applique pas |
| Oublier la correction de continuité | Erreur de plusieurs points |
| \(\sigma(\overline X) = \frac{\sigma}{n}\) | C'est \(\frac{\sigma}{\sqrt n}\) |
| Croire que \(X_i\) devient normale | C'est la moyenne qui le devient |
| Appliquer le TCL à des variables dépendantes | Hypothèse essentielle |
Exercices¶
★ Exercice 1. \(X_1,\dots,X_{100}\) indépendantes, de même loi, avec \(\mu=10\) et \(\sigma=4\).
a) Loi approchée de \(\overline X\). b) Loi approchée de \(S = \sum X_i\). c) Calculer \(P(\overline X > 10{,}5)\).
★★ Exercice 2. \(X\sim\mathcal{B}(200\,;0{,}4)\).
a) Justifier l'approximation normale. b) Calculer \(P(X\leqslant70)\) avec correction de continuité. c) Calculer \(P(75\leqslant X\leqslant85)\).
★★ Exercice 3. Une pièce est lancée 1000 fois.
a) Espérance et écart-type du nombre de piles. b) Probabilité d'obtenir entre 480 et 520 piles. c) Dans quel intervalle se trouve ce nombre avec probabilité 95 % ?
★★★ Exercice 4. Un institut sonde 1200 personnes ; 636 déclarent voter « oui ».
a) Estimation ponctuelle de \(p\). b) Intervalle de confiance à 95 %. c) Peut-on affirmer que le « oui » l'emportera ?
★★★ Exercice 5. Une compagnie aérienne vend 320 billets pour un avion de 300 places. Chaque passager se présente avec probabilité 0,9, indépendamment.
a) Loi du nombre de passagers présents. b) Probabilité de surréservation (plus de 300 présents). c) Combien de billets vendre pour que ce risque soit inférieur à 1 % ?
★★★ Exercice 6. Démontrer la loi faible des grands nombres pour des variables de Bernoulli, et en déduire une majoration explicite du nombre de lancers nécessaires pour estimer \(p\) à \(0{,}01\) près avec probabilité 0,99 :
a) par Bienaymé-Tchebychev ; b) par le TCL. c) Comparer les deux bornes.
★★★★ Exercice 7. On admet que pour \(X\sim\mathcal{P}(\lambda)\) avec \(\lambda\) grand, \(X\approx\mathcal{N}(\lambda,\lambda)\).
a) Justifier par le TCL, en écrivant \(X\) comme somme. Indication : la somme de deux Poisson indépendantes est une Poisson. b) Application : un standard reçoit 400 appels par jour en moyenne. Probabilité d'en recevoir plus de 440 ? c) Comparer avec le calcul exact.
★★★★ Exercice 8 — lien informatique. Vérification numérique du TCL.
a) Simuler \(10^4\) réalisations de \(\overline X_n\) pour \(X_i\) suivant une loi exponentielle de paramètre 1, avec \(n = 1, 2, 5, 30\). b) Pour chaque \(n\), tracer (ou tabuler) la distribution empirique de \(\frac{\overline X_n - 1}{1/\sqrt n}\) et comparer à \(\mathcal{N}(0,1)\). c) À partir de quel \(n\) l'approximation devient-elle acceptable ? d) Refaire avec une loi de Cauchy (\(\tan(\pi(U-\frac12))\)) et commenter.
Corrigés¶
Corrigé — Exercice 1
a) \(\overline X \approx \mathcal{N}\!\left(10,\ \frac{16}{100}\right)\), soit \(\sigma_{\overline X} = 0{,}4\).
b) \(S \approx \mathcal{N}(1000,\ 1600)\), soit \(\sigma_S = 40\).
c) \(z = \frac{10{,}5-10}{0{,}4} = 1{,}25\).
Corrigé — Exercice 2
a) \(np = 80\geqslant5\) et \(n(1-p) = 120\geqslant5\) ✓
\(\mu = 80\), \(\sigma = \sqrt{200\times0{,}4\times0{,}6} = \sqrt{48} \approx 6{,}928\).
b) \(z = \frac{70{,}5-80}{6{,}928} = -1{,}371\).
(Valeur exacte : \(0{,}0844\) — erreur de 0,9 %.)
c) \(z_1 = \frac{74{,}5-80}{6{,}928} = -0{,}794\) ; \(z_2 = \frac{85{,}5-80}{6{,}928} = 0{,}794\).
Corrigé — Exercice 3
\(X\sim\mathcal{B}(1000\,;0{,}5)\).
a) \(\mu = 500\), \(\sigma = \sqrt{250} \approx 15{,}81\).
b) Avec correction : \(z_1 = \frac{479{,}5-500}{15{,}81} = -1{,}296\) ; \(z_2 = \frac{520{,}5-500}{15{,}81} = 1{,}296\).
c) Intervalle à 95 % :
Entre 469 et 531 piles, avec probabilité 95 %.
Corrigé — Exercice 4
a) \(\hat p = \frac{636}{1200} = 0{,}53\).
b)
Marge : \(1{,}96\times0{,}01441 \approx 0{,}0282\).
c) L'intervalle est entièrement au-dessus de 0,5 — mais de peu : sa borne inférieure vaut 0,502.
On peut affirmer que le « oui » l'emporte au niveau de confiance 95 %, mais la marge est étroite : un écart de 0,2 point suffirait à basculer.
Les limites du modèle
Ce calcul suppose un échantillonnage aléatoire simple. Un sondage réel souffre de non-réponse, de biais de sélection et de mensonge déclaratif — dont les effets dépassent souvent la marge d'erreur statistique.
Comme au chapitre 10, exercice 8 : la méthode d'échantillonnage compte plus que la taille.
Corrigé — Exercice 5
a) \(X\sim\mathcal{B}(320\,;0{,}9)\).
\(\mu = 288\), \(\sigma = \sqrt{320\times0{,}9\times0{,}1} = \sqrt{28{,}8} \approx 5{,}367\).
b) Avec correction de continuité :
Environ 1 %.
c) Cherchons \(n\) tel que \(P(X>300)\leqslant0{,}01\) avec \(X\sim\mathcal{B}(n\,;0{,}9)\).
On veut \(\frac{300{,}5-0{,}9n}{\sqrt{0{,}09n}} \geqslant 2{,}326\).
Pour \(n=320\) : \(z = 2{,}329\) ✓ (juste à la limite). Pour \(n=321\) : \(\mu = 288{,}9\), \(\sigma = 5{,}376\), \(z = \frac{11{,}6}{5{,}376} = 2{,}158\), soit \(P\approx0{,}0155 > 0{,}01\) ✗
320 billets est donc le maximum.
Le calcul que font vraiment les compagnies
Elles ne minimisent pas la probabilité de surréservation, mais le coût espéré : coût d'un siège vide contre coût d'un passager refusé (indemnisation, réputation). Le seuil optimal est celui où les deux coûts marginaux s'égalisent — un problème d'optimisation, au programme du module OSCO23 en deuxième année.
Corrigé — Exercice 6
Pour des Bernoulli, \(\mu = p\) et \(\sigma^2 = p(1-p)\leqslant\frac14\).
a) Par Tchebychev.
On veut cette majoration \(\leqslant0{,}01\) :
b) Par le TCL. On veut \(1{,}96\ldots\) — non, au niveau 99 % le quantile est \(2{,}576\) :
c) Comparaison.
| Méthode | \(n\) requis |
|---|---|
| Tchebychev | 250 000 |
| TCL | 16 590 |
Tchebychev demande 15 fois plus d'observations pour la même garantie.
Mais : Tchebychev donne une borne exacte et valable pour tout \(n\), alors que le TCL est une approximation asymptotique. Pour de petits échantillons ou des lois très asymétriques, le TCL peut être trompeur là où Tchebychev reste vrai.
C'est le compromis classique entre garantie universelle et précision.
Corrigé — Exercice 7
a) La somme de deux variables de Poisson indépendantes de paramètres \(\lambda_1\) et \(\lambda_2\) suit \(\mathcal{P}(\lambda_1+\lambda_2)\).
Par conséquent, \(X\sim\mathcal{P}(\lambda)\) peut s'écrire comme la somme de \(n\) variables indépendantes de loi \(\mathcal{P}\!\left(\frac\lambda n\right)\), et ce pour tout \(n\).
Prenons \(n = \lambda\) (supposé entier) : \(X\) est la somme de \(\lambda\) variables i.i.d. de loi \(\mathcal{P}(1)\), chacune d'espérance 1 et de variance 1.
Par le TCL, quand \(\lambda\to+\infty\) :
soit \(X\approx\mathcal{N}(\lambda,\lambda)\) ✓ \(\blacksquare\)
(On retrouve bien \(\mathbb{E}=\operatorname{V}=\lambda\).)
b) \(\lambda = 400\), \(\sigma = 20\).
Avec correction de continuité :
c) Calcul exact :
Erreur relative de 5,7 % — l'approximation est excellente, et infiniment plus commode que la somme de 441 termes contenant des factorielles de nombres à trois chiffres.
Corrigé — Exercice 8
a), b) et c) — Implémentation.
import math
import random
def moyennes_normalisees(loi, mu, sigma, n, repetitions, rng):
"""Renvoie les (Xbar_n - mu) / (sigma/sqrt(n))."""
res = []
for _ in range(repetitions):
s = sum(loi(rng) for _ in range(n))
xbar = s / n
res.append((xbar - mu) / (sigma / math.sqrt(n)))
return res
def Phi(z):
return 0.5 * (1 + math.erf(z / math.sqrt(2)))
def ecart_max_a_la_normale(ech):
"""Statistique de Kolmogorov : ecart max entre F empirique et Phi."""
ech = sorted(ech)
m = len(ech)
return max(max(abs((i + 1) / m - Phi(z)), abs(i / m - Phi(z)))
for i, z in enumerate(ech))
expo = lambda rng: -math.log(rng.random()) # E(1) : mu = sigma = 1
print("loi exponentielle E(1)")
for n in (1, 2, 5, 30, 100):
rng = random.Random(11)
ech = moyennes_normalisees(expo, 1.0, 1.0, n, 10_000, rng)
print(f" n={n:4d} ecart max a N(0,1) = {ecart_max_a_la_normale(ech):.4f}")
Sortie :
loi exponentielle E(1)
n= 1 ecart max a N(0,1) = 0.1587
n= 2 ecart max a N(0,1) = 0.0884
n= 5 ecart max a N(0,1) = 0.0542
n= 30 ecart max a N(0,1) = 0.0214
n= 100 ecart max a N(0,1) = 0.0168
Lecture. L'écart maximal entre la répartition empirique et \(\Phi\) décroît régulièrement : \(0{,}159 \to 0{,}017\), soit un facteur 9,5 entre \(n=1\) et \(n=100\).
Il décroît approximativement comme \(\frac{1}{\sqrt n}\) — c'est la vitesse prédite par le théorème de Berry-Esseen, qui quantifie la convergence du TCL.
À partir de quel \(n\) ? L'écart passe sous 3 % vers \(n=30\) : la règle usuelle « \(n\geqslant30\) » est confirmée, y compris pour une loi asymétrique comme l'exponentielle.
d) Loi de Cauchy.
cauchy = lambda rng: math.tan(math.pi * (rng.random() - 0.5))
print("loi de Cauchy (sans variance)")
rng = random.Random(11)
for n in (1, 10, 100, 1000):
ech = [sum(cauchy(rng) for _ in range(n)) / n for _ in range(2000)]
ech.sort()
q1, med, q3 = ech[500], ech[1000], ech[1500]
print(f" n={n:5d} Q1={q1:+.3f} med={med:+.3f} Q3={q3:+.3f} "
f"max|x|={max(abs(x) for x in ech):.1f}")
Sortie typique :
loi de Cauchy (sans variance)
n= 1 Q1=-0.996 med=-0.028 Q3=+0.936 max|x|=2817.3
n= 10 Q1=-1.039 med=-0.005 Q3=+0.982 max|x|=18693.1
n= 100 Q1=-0.968 med=-0.063 Q3=+0.957 max|x|=2097.9
n= 1000 Q1=-0.946 med=+0.034 Q3=+1.006 max|x|=3777.9
Commentaire. Les quartiles ne bougent pas : la moyenne de \(n\) variables de Cauchy suit exactement la même loi de Cauchy, quel que soit \(n\). Moyenner n'apporte strictement rien.
La loi des grands nombres et le TCL échouent tous les deux, parce que la loi de Cauchy n'a ni espérance ni variance : les intégrales \(\int|x|f(x)\mathrm{d}x\) divergent.
La leçon pratique
« Moyenner réduit le bruit » est une affirmation conditionnelle : elle exige une variance finie. Sur des données à queue lourde — temps de réponse, tailles de fichiers, rendements financiers en crise — la moyenne peut ne jamais se stabiliser, quel que soit le volume collecté.
C'est exactement ce qui a été établi à l'exercice 9 du chapitre Analyse 09 et à l'exercice 9 du chapitre 08 : la médiane et les percentiles, eux, restent robustes.
Fin de la partie Probabilité. Chapitre suivant : Modélisation mathématique — MOMA11.