Aller au contenu

Probabilités · 4 affiches · formule n° 72

Le théorème central limite

Le théorème central limite dit que la somme d’un grand nombre de variables aléatoires indépendantes et de même loi, une fois centrée et réduite, suit presque une loi normale. C’est pourquoi la courbe en cloche apparaît partout.

Voir les 4 affiches 12 contrôles par le calcul

Pour des variables XiX_i indépendantes, de même loi, de variance σ2\sigma^2 finie et non nulle. Dessin : densités exactes de la somme centrée réduite de nn variables de loi exponentielle, pour n=1,2,4,8,16,32n = 1, 2, 4, 8, 16, 32 et 6464 ; en pointillé, la loi normale N(0,1)\mathcal{N}(0, 1).

Quatre styles

Les affiches

La même formule, le même dessin calculé, en Papier, Nuit, Bauhaus ou Tableau noir. En affiche, toile, plexiglas ou aluminium.

Ce que dit le théorème

Soit X1,X2,X3,…X_1, X_2, X_3, \ldots une suite de variables aléatoires réelles indépendantes, de même loi, d’espérance μ\mu et de variance σ2\sigma^2 finie et non nulle. Alors, quand nn tend vers l’infini,

X1+⋯+Xn−nμσn→n→∞loiN(0,1)\frac{X_1 + \cdots + X_n - n\mu}{\sigma\sqrt{n}} \xrightarrow[n \to \infty]{\text{loi}} \mathcal{N}(0,\,1)

ce qui signifie : pour tout nombre réel xx, la probabilité que le membre de gauche soit inférieur ou égal à xx tend vers Φ(x)=12π∫−∞xe−t2/2dt\Phi(x) = \frac{1}{\sqrt{2\pi}} \int_{-\infty}^{x} e^{-t^2/2}\, \mathrm{d}t, la probabilité correspondante pour la loi normale centrée réduite.

  • X1,…,XnX_1, \ldots, X_n : les variables que l’on additionne (les résultats de nn lancers de dé, nn mesures répétées…).
  • μ=E(Xi)\mu = E(X_i) : l’espérance commune ; la somme a pour espérance nμn\mu.
  • σ2=V(Xi)\sigma^2 = V(X_i) : la variance commune. Comme les variables sont indépendantes, les variances s’ajoutent : la somme a pour variance nσ2n\sigma^2, donc pour écart type σn\sigma\sqrt{n}.
  • La fraction est la somme centrée (on retire sa moyenne) et réduite (on divise par son écart type) : elle a toujours pour moyenne 0 et pour écart type 1.
  • La flèche marquée « loi » désigne la convergence en loi : ce sont les probabilités qui convergent, pas les valeurs elles-mêmes.
  • N(0,1)\mathcal{N}(0, 1) : la loi normale de moyenne 0 et d’écart type 1.

En pratique, on retient que pour nn grand, la somme X1+⋯+XnX_1 + \cdots + X_n suit à peu près la loi normale de moyenne nμn\mu et d’écart type σn\sigma\sqrt{n}, et la moyenne X1+⋯+Xnn\frac{X_1 + \cdots + X_n}{n} la loi normale de moyenne μ\mu et d’écart type σn\frac{\sigma}{\sqrt{n}}.

Les hypothèses comptent. Sans variance finie, le théorème tombe : la moyenne de nn variables de loi de Cauchy suit encore la loi de Cauchy, quel que soit nn, et ne se resserre jamais. Sans indépendance aussi : si l’on recopie nn fois le même lancer de dé, la somme vaut nn fois ce lancer et ne prend jamais la forme d’une cloche.

À quelle vitesse ? Le théorème de Berry-Esseen le précise quand ρ=E(|Xi−μ|3)\rho = E\big(|X_i - \mu|^3\big) est fini : l’écart entre les probabilités exactes et celles de la loi normale ne dépasse jamais Cρσ3n\frac{C\rho}{\sigma^3\sqrt{n}}, avec une constante CC dont la meilleure valeur connue est inférieure à 0,4748. L’erreur décroît donc comme 1n\frac{1}{\sqrt{n}}, plus lentement pour une loi de départ très dissymétrique. La règle pratique souvent citée « n≥30n \geq 30 » n’est qu’un ordre de grandeur.

Un exemple

On lance 100 dés équilibrés et l’on additionne les résultats. Un dé a pour espérance μ=3,5\mu = 3{,}5 et pour variance σ2=3512\sigma^2 = \frac{35}{12}, environ 2,916.

  1. Moyenne et écart type de la somme. La somme SS a pour espérance 100×3,5=350100 \times 3{,}5 = 350 et pour variance 100×3512=8753100 \times \frac{35}{12} = \frac{875}{3}, environ 291,666 ; son écart type vaut donc environ 17,078.
  2. Probabilité que la somme ne dépasse pas 370. SS ne prend que des valeurs entières : on vise le milieu, 370,5. On centre et réduit : 370,5−35017,078\frac{370{,}5 - 350}{17{,}078}, environ 1,200. La loi normale donne Φ(1,200)\Phi(1{,}200), environ 0,884 9.
  3. Comparaison avec la valeur exacte. En dénombrant exactement les 61006^{100} issues possibles, on trouve environ 0,884 8. Sans la demi-unité de l’étape 2, on aurait obtenu environ 0,879 2.
  4. Un intervalle à 95 %. Pour la loi normale, 95 % des valeurs sont à moins de 1,96 écart type de la moyenne. Ici, 350±1,96×17,078350 \pm 1{,}96 \times 17{,}078 donne l’intervalle de 316,5 à 383,5 environ. Le calcul exact donne P(317≤S≤383)P(317 \leq S \leq 383) environ égal à 0,950 3.

Pourquoi c’est vrai

La démonstration complète dépasse le cadre de cette page ; l’idée est la suivante.

On remplace chaque loi par sa fonction caractéristique φ(t)=E(eitX)\varphi(t) = E\big(e^{itX}\big), une sorte d’empreinte qui détermine la loi et qui transforme une somme de variables indépendantes en produit. Posons Yi=Xi−μσY_i = \frac{X_i - \mu}{\sigma}, de moyenne 0 et de variance 1. Pour tt petit, sa fonction caractéristique vaut φY(t)=1−t22+ε(t)t2\varphi_Y(t) = 1 - \frac{t^2}{2} + \varepsilon(t)\, t^2, où ε(t)\varepsilon(t) tend vers 0 avec tt : seules la moyenne et la variance apparaissent dans ce développement. La somme centrée réduite vaut Zn=Y1+⋯+YnnZ_n = \frac{Y_1 + \cdots + Y_n}{\sqrt{n}}, donc

φZn(t)=(φY(tn))n=(1−t22n+εnt2n)n→n→∞e−t2/2,\varphi_{Z_n}(t) = \left(\varphi_Y\Big(\frac{t}{\sqrt{n}}\Big)\right)^n = \left(1 - \frac{t^2}{2n} + \frac{\varepsilon_n\, t^2}{n}\right)^n \xrightarrow[n \to \infty]{} e^{-t^2/2},

où εn\varepsilon_n tend vers 0. Or e−t2/2e^{-t^2/2} est exactement la fonction caractéristique de la loi N(0,1)\mathcal{N}(0, 1). Un théorème dû à Paul Lévy (théorème de continuité) permet alors de passer de la convergence des fonctions caractéristiques à la convergence en loi. Le calcul montre aussi pourquoi la limite est universelle : tous les détails de la loi de départ, sauf sa moyenne et sa variance, disparaissent.

Les programmes de l’atelier vérifient le théorème par le calcul : valeurs de référence de Φ\Phi, densités exactes du dessin (aire 1, moyenne 0, variance 1), décroissance de l’écart à la loi normale et respect de la borne de Berry-Esseen pour des sommes de variables exponentielles et de dés, 100 000 sommes simulées, et deux contre-exemples (loi de Cauchy, variables recopiées).

Un peu d’histoire

La première version remonte à Abraham de Moivre qui, dans un texte de 1733, approche la loi du nombre de piles sur un grand nombre de lancers de pièce par la courbe que l’on appelle aujourd’hui courbe de Gauss. Pierre-Simon de Laplace étend ce résultat au début du XIXe siècle, notamment dans sa Théorie analytique des probabilités (1812). Une démonstration rigoureuse sous des hypothèses générales est donnée par le mathématicien russe Alexandre Liapounov en 1901 ; la forme énoncée ici, pour des variables de même loi, est souvent appelée théorème de Lindeberg-Lévy, du nom de deux mathématiciens qui l’ont travaillée au début des années 1920.

Le nom vient de George Pólya, qui emploie en 1920 l’expression allemande zentraler Grenzwertsatz, « théorème limite central », pour souligner le rôle central de ce résultat en probabilités. On dit aussi en français « théorème de la limite centrale ».

Ce que montre l’affiche

Le dessin superpose, de haut en bas, la loi exacte de la somme centrée réduite de nn variables de loi exponentielle (de moyenne 1 et d’écart type 1), pour nn = 1, 2, 4, 8, 16, 32 et 64. La loi exponentielle décrit par exemple l’attente entre deux événements d’un processus de Poisson ; elle est très dissymétrique, ce qui rend la convergence visible. La somme de nn telles variables a une densité connue exactement, sn−1e−s(n−1)!\frac{s^{n-1} e^{-s}}{(n-1)!}, que le programme trace sans simulation. Pour n=1n = 1, la courbe démarre brusquement en −1-1 ; à mesure que nn double, elle se redresse et rejoint la cloche N(0,1)\mathcal{N}(0, 1), tracée en pointillé sur chaque rangée. L’écart maximal entre les probabilités exactes et celles de la loi normale passe d’environ 0,158 pour n=1n = 1 à environ 0,016 pour n=64n = 64. L’affiche existe en quatre styles : Papier, Nuit, Bauhaus et Tableau noir.

Pour aller plus loin

Sources : Théorème central limite (Wikipédia) (nouvel onglet), Central limit theorem (Wikipedia) (nouvel onglet), Central Limit Theorem (MathWorld) (nouvel onglet), Berry–Esseen theorem (Wikipedia) (nouvel onglet), Loi exponentielle (Wikipédia) (nouvel onglet).

Vérifiée par le calcul

Les contrôles de cette formule

Avant d'imprimer l'affiche, un programme met la formule à l'épreuve. Voici ce qu'il a calculé (dernier passage le 11 octobre 2026) ; si un seul de ces contrôles échouait, l'affiche ne serait pas produite. Notre méthode

  • Φ(1) = 0,841 344 746 068 542…obtenu 0.8413447460685428, attendu 0.8413447460685429, écart 1.32e-16 (tolérance 1e-12)
  • Φ(1,96) = 0,975 002 104 851 780…obtenu 0.9750021048517805, attendu 0.9750021048517795, écart 1.02e-15 (tolérance 1e-12)
  • Φ(−1) = 1 − Φ(1) = 0,158 655 253 931 457…obtenu 0.15865525393145713, attendu 0.15865525393145707, écart 3.50e-16 (tolérance 1e-11)
  • densités du dessin (n = 1, 2, 4, 8, 16, 32, 64) : aire 1, moyenne 0, variance 1écart maximal 1.08e-13
  • somme de variables exponentielles : densité de S₂ = convolution f₁ * f₁, de S₄ = f₂ * f₂ (5 valeurs de s)écart relatif maximal 9.38e-14
  • exponentielle : ρ = E|X − 1|³ = 12/e − 2 (intégration numérique)obtenu 2.414553294056841, attendu 2.414553294057308, écart 1.93e-13 (tolérance 1e-10)
  • sommes d’exponentielles : sup|P(Z_n ≤ z) − Φ(z)| diminue quand n double (n = 1 à 256)1 : 0.1587 ; 2 : 0.0945 ; 4 : 0.0667 ; 8 : 0.0471 ; 16 : 0.0333 ; 32 : 0.0235 ; 64 : 0.0166 ; 128 : 0.0118 ; 256 : 0.0083
  • … et reste sous la borne de Berry-Esseen 0.4748 ρ/√n
  • sommes de n dés (lois exactes) : la distance à Φ diminue et reste sous la borne de Berry-Esseen1 : 0.1434 ; 2 : 0.0833 ; 4 : 0.0588 ; 8 : 0.0415 ; 16 : 0.0293 ; 32 : 0.0207 ; 64 : 0.0146 ; 128 : 0.0103
  • simulation : 100 000 sommes de 64 exponentielles ; fréquences de {Z ≤ z} (z = −2 … 2) à moins de 4,5 écarts types de la loi exacteécart maximal 1.32 écarts types
  • contre-exemple (variance infinie) : moyenne de 200 variables de Cauchy, P(|moyenne| > 1) reste 1/2 comme pour une seule (20000 essais)fréquence 0.5026
  • contre-exemple (sans indépendance) : X_i = X_1 pour un dé, n = 100 ; P(|Z_n| ≤ 1) = 0 au lieu de Φ(1) − Φ(−1) ≈ 0,68

Sources

Questions fréquentes

Que dit le théorème central limite en termes simples ?

Quand on additionne beaucoup de variables aléatoires indépendantes, de même loi et de variance finie, la somme suit approximativement une loi normale, quelle que soit la loi de départ. Il suffit de connaître la moyenne et l’écart type de chaque variable.

Quelle différence avec la loi des grands nombres ?

La loi des grands nombres dit que la moyenne de nn variables se rapproche de l’espérance μ\mu. Le théorème central limite décrit les écarts autour de μ\mu : ils sont de l’ordre de σn\frac{\sigma}{\sqrt{n}} et suivent approximativement une loi normale.

À partir de combien de variables peut-on l’appliquer ?

Il n’y a pas de seuil universel : la qualité de l’approximation dépend de la loi de départ. Le théorème de Berry-Esseen garantit une erreur de l’ordre de 1n\frac{1}{\sqrt{n}} ; la règle « n≥30n \geq 30 » n’est qu’une habitude pratique, insuffisante pour des lois très dissymétriques.

Le théorème central limite s’applique-t-il toujours ?

Non. Il faut l’indépendance (ou des formes affaiblies) et une variance finie. Pour la loi de Cauchy, dont la variance est infinie, la moyenne de nn variables garde la même loi que chacune d’elles.

Pourquoi dit-on « central » ?

Le nom vient de George Pólya, qui l’a introduit en 1920 en allemand pour souligner le rôle central de ce théorème en probabilités. On dit aussi « théorème de la limite centrale ».