Pas de panique : tu n'as jamais vu la loi normale, le contrôle est dans deux jours, et le mot « cloche » te fait déjà transpirer. Respire. Derrière tout ça il y a un seul dessin, une cloche, et trois nombres à retenir. On fait au plus court, juste ce qu'il faut pour t'en sortir demain.

Les prérequis et la cloche en 30 secondes

Prérequis express. Il te faut trois choses seulement : lire une probabilité comme une proportion (un $P$ compris entre $0$ et $1$), savoir que $\mu$ est la moyenne (le centre) et $\sigma$ l'écart-type (l'étalement), et manier fractions et racines carrées.

L'idée. Une variable $X$ suit une loi normale quand sa courbe est une cloche symétrique, centrée sur $\mu$. On note $X \sim \mathcal{N}(\mu,\,\sigma^2)$. Plus $\sigma$ est grand, plus la cloche est large. Piège de vocabulaire : le second nombre écrit est la variance $\sigma^2$, pas $\sigma$.

Les trois choses à retenir absolument :

$P(\mu - \sigma \le X \le \mu + \sigma) \approx 0{,}683$ (environ $68\%$)

$P(\mu - 2\sigma \le X \le \mu + 2\sigma) \approx 0{,}954$ (environ $95\%$)

Et la symétrie de la cloche : $P(X \ge \mu + a) = P(X \le \mu - a)$.

≈ 68 %μμ−σμ+σ

Un exemple entièrement traité

Énoncé. La masse $X$ (en g) d'un sachet suit $\mathcal{N}(200,\,10^2)$. Donc $\mu = 200$ et $\sigma = 10$.

Étape 1. On repère $\mu \pm \sigma$ : $200 - 10 = 190$ et $200 + 10 = 210$. La règle du premier écart-type donne directement $P(190 \le X \le 210) \approx 0{,}683$.

Étape 2. On repère $\mu \pm 2\sigma$ : $200 - 20 = 180$ et $200 + 20 = 220$. Deuxième règle : $P(180 \le X \le 220) \approx 0{,}954$.

Étape 3. On veut $P(X \ge 220)$. Comme $220 = \mu + 2\sigma$, il reste $1 - 0{,}954 = 0{,}046$ hors de l'intervalle central, réparti dans les deux queues. Par symétrie chacune vaut la moitié : $P(X \ge 220) = \dfrac{1 - 0{,}954}{2} \approx 0{,}023$.

Conclusion. Environ $2{,}3\%$ des sachets pèsent $220$ g ou plus.

Et l'intervalle de confiance, en deux lignes

Le deuxième morceau du chapitre. Parfois on ne connaît pas une proportion $p$ dans une population (par exemple le pourcentage de gens qui aiment un produit). On prélève un échantillon de taille $n$, on observe la fréquence $f$, et on encadre $p$.

La formule à $95\%$ : $I_C = \left[\,f - \dfrac{1}{\sqrt{n}}\,;\; f + \dfrac{1}{\sqrt{n}}\,\right]$.

Mini-exemple. Sur $n = 400$ personnes, $240$ aiment le produit. Alors $f = \dfrac{240}{400} = 0{,}6$ et la demi-largeur vaut $\dfrac{1}{\sqrt{400}} = \dfrac{1}{20} = 0{,}05$. Donc $I_C = [\,0{,}55\,;\,0{,}65\,]$. On estime, au niveau $95\%$, que $p$ est entre $55\%$ et $65\%$.

Ah, ça y est, ça te revient : la petite cloche, le fameux 95 %, l'histoire de la proportion qu'on estime… On reprend proprement, dans l'ordre, avec les définitions et une vraie méthode. Rien de sorcier, juste bien rangé.

La loi normale : définition propre

Définition. Une variable aléatoire $X$ suit la loi normale de paramètres $\mu$ (l'espérance) et $\sigma > 0$ (l'écart-type), notée $X \sim \mathcal{N}(\mu,\,\sigma^2)$, lorsque sa courbe de densité est la fameuse cloche : une courbe symétrique par rapport à la droite verticale d'abscisse $\mu$, avec son maximum en $\mu$.

$\mu$ fixe la position du sommet ; $\sigma$ fixe la largeur : plus $\sigma$ est grand, plus la cloche est basse et étalée ; plus il est petit, plus elle est resserrée autour de $\mu$.

À quoi ça sert. La loi normale modélise toute grandeur qui résulte d'un grand nombre de petits effets aléatoires indépendants : taille d'individus, erreur de mesure, score moyen d'un grand groupe à un examen. C'est la loi « par défaut » de la variabilité naturelle.

≈ 68 %≈ 95 %μμ−σμ+σμ−2σμ+2σ

Les valeurs à connaître et la symétrie

La règle des $k$ écarts-types donne, sans calcul, l'aire sous la cloche autour du centre :

$P(\mu - \sigma \le X \le \mu + \sigma) \approx 0{,}683$

$P(\mu - 2\sigma \le X \le \mu + 2\sigma) \approx 0{,}954$

Et la valeur « propre » pour un $95\%$ exact : $P(\mu - 1{,}96\,\sigma \le X \le \mu + 1{,}96\,\sigma) = 0{,}95$.

La symétrie est ton outil pour passer d'un intervalle centré à une queue. Comme la cloche est symétrique autour de $\mu$ : $P(X \le \mu - a) = P(X \ge \mu + a)$. Et pour une seule queue à partir d'un intervalle centré : $P(X \ge \mu + a) = \dfrac{1 - P(\mu - a \le X \le \mu + a)}{2}$.

Exemple flash. Si $P(\mu - 2\sigma \le X \le \mu + 2\sigma) \approx 0{,}954$, alors chaque queue vaut $\dfrac{1 - 0{,}954}{2} \approx 0{,}023$, donc $P(X \ge \mu + 2\sigma) \approx 0{,}023$.

L'intervalle de confiance d'une proportion : méthode pas-à-pas

Le problème. On veut connaître une proportion $p$ inconnue dans une grande population. On prélève un échantillon de taille $n$ (grand), on compte l'effectif du caractère étudié, et on en déduit la fréquence observée $f = \dfrac{\text{effectif observé}}{n}$.

La formule (niveau de confiance $95\%$) : $I_C = \left[\,f - \dfrac{1}{\sqrt{n}}\,;\; f + \dfrac{1}{\sqrt{n}}\,\right]$.

Méthode pas-à-pas.

1. Identifier $n$ (taille de l'échantillon) et l'effectif observé du caractère.

2. Calculer la fréquence $f = \dfrac{\text{effectif observé}}{n}$.

3. Calculer la demi-largeur $e = \dfrac{1}{\sqrt{n}}$.

4. Écrire $I_C = [\,f - e\,;\, f + e\,]$ et conclure par une phrase : « On estime, au niveau $95\%$, que $p \in I_C$. »

Comment le lire. Le niveau $95\%$ ne porte pas sur cet intervalle-ci en particulier : il dit que le procédé de construction produit, sur de nombreux échantillons, des intervalles qui contiennent la vraie valeur $p$ dans environ $95\%$ des cas.

Ne pas confondre. L'intervalle de fluctuation part de $p$ connu et encadre la fréquence $F_n$ ; l'intervalle de confiance part de $f$ observé et estime $p$ inconnu. C'est le sens inverse.

Intervalle de confiance à 95 %f − 1/√nff + 1/√n

Maintenant on retrousse les manches et on fait des exemples ensemble, ligne par ligne. Tu ne fais rien tout seul ici : tu regardes comment on rédige, et tu voles la méthode.

Exemple 1 — la loi normale, commentée ligne par ligne

On le fait ensemble. Énoncé. Dans une population, la taille $X$ (en cm) suit $\mathcal{N}(170,\,6^2)$, donc $\mu = 170$ et $\sigma = 6$.

Ligne 1 — on prépare les repères. $\mu - \sigma = 164$ et $\mu + \sigma = 176$ ; $\mu - 2\sigma = 158$ et $\mu + 2\sigma = 182$. On note tout avant de calculer, ça évite les erreurs.

Ligne 2 — un écart-type. $P(164 \le X \le 176) = P(\mu - \sigma \le X \le \mu + \sigma) \approx 0{,}683$. Environ $68\%$ des tailles sont entre $164$ et $176$ cm.

Ligne 3 — deux écarts-types. $P(158 \le X \le 182) = P(\mu - 2\sigma \le X \le \mu + 2\sigma) \approx 0{,}954$.

Ligne 4 — une queue par symétrie. On veut $P(X \le 158)$. Comme $158 = \mu - 2\sigma$, on retire l'intervalle central et on partage ce qui reste en deux : $P(X \le 158) = \dfrac{1 - 0{,}954}{2} \approx 0{,}023$.

Ligne 5 — vérification de bon sens. $2{,}3\%$, c'est petit : logique, $158$ cm est loin dans la queue de gauche. Et par symétrie $P(X \ge 182) \approx 0{,}023$ aussi.

≈ 2,3 %158164170176182

Exemple 2 — un intervalle de confiance, pas à pas

Énoncé. Un sondage interroge $n = 400$ personnes ; $240$ se déclarent favorables à une mesure. Construis un intervalle de confiance à $95\%$ de la proportion $p$ de la population favorable.

Ligne 1 — la fréquence. $f = \dfrac{240}{400} = 0{,}6$. C'est la proportion observée dans l'échantillon.

Ligne 2 — la demi-largeur. $e = \dfrac{1}{\sqrt{n}} = \dfrac{1}{\sqrt{400}} = \dfrac{1}{20} = 0{,}05$.

Ligne 3 — l'intervalle. $I_C = [\,0{,}6 - 0{,}05\,;\, 0{,}6 + 0{,}05\,] = [\,0{,}55\,;\,0{,}65\,]$.

Ligne 4 — la phrase de conclusion. On estime, au niveau de confiance $95\%$, que la proportion $p$ de personnes favorables dans la population est comprise entre $55\%$ et $65\%$.

IC à 95 % : [ 0,55 ; 0,65 ]0,55f = 0,600,65

Exemple 3 — le piège variance / écart-type

Le petit exemple qui piège tout le monde. On donne $X \sim \mathcal{N}(500,\,400)$ et on demande $P(X \ge 540)$.

Ligne 1 — attention au deuxième paramètre. Ici $\sigma^2 = 400$, ce n'est pas $\sigma$. Donc $\sigma = \sqrt{400} = 20$ (et surtout pas $400$).

Ligne 2 — on situe $540$. $\mu + 2\sigma = 500 + 40 = 540$. On est donc pile à deux écarts-types.

Ligne 3 — la queue. $P(X \ge 540) = P(X \ge \mu + 2\sigma) = \dfrac{1 - 0{,}954}{2} \approx 0{,}023$.

Morale : dès que tu vois $\mathcal{N}(\mu,\,\text{quelque chose})$, demande-toi si « quelque chose » est $\sigma$ ou $\sigma^2$. C'est presque toujours $\sigma^2$.

Niveau contrôle (et bac). On s'attaque à de vrais énoncés, entiers, et surtout on regarde ce que le correcteur veut voir sur ta copie, parce qu'un bon résultat mal justifié laisse des points sur la table.

Problème type 1 — contrôle qualité (loi normale)

Énoncé. La durée de vie $X$ (en heures) d'un modèle d'ampoule suit $\mathcal{N}(1200,\,50^2)$. On a donc $\mu = 1200$ et $\sigma = 50$.

a) $P(1100 \le X \le 1300)$. On reconnaît $1100 = \mu - 2\sigma$ et $1300 = \mu + 2\sigma$, donc $P(1100 \le X \le 1300) \approx 0{,}954$.

b) $P(X \ge 1300)$. C'est la queue à droite au-delà de $\mu + 2\sigma$ : $P(X \ge 1300) = \dfrac{1 - 0{,}954}{2} \approx 0{,}023$.

c) $P(X \le 1150)$. Ici $1150 = \mu - \sigma$. On part de $P(\mu - \sigma \le X \le \mu + \sigma) \approx 0{,}683$, donc la queue à gauche vaut $P(X \le 1150) = \dfrac{1 - 0{,}683}{2} \approx 0{,}1585$.

Conclusion rédigée. Environ $2{,}3\%$ des ampoules dépassent $1300$ h, et environ $15{,}9\%$ ne tiennent pas $1150$ h.

Ce que le correcteur attend. Que tu nommes la règle utilisée (« $1100$ et $1300$ correspondent à $\mu \pm 2\sigma$ »), que tu justifies la queue par la symétrie plutôt que de sortir un nombre du chapeau, et que tu termines par une phrase en français avec l'unité et une valeur arrondie proprement.

≈ 2,3 %11001150120012501300

Problème type 2 — sondage et la subtilité qui rapporte des points

Énoncé. Avant un vote, un institut interroge $n = 1000$ personnes : $520$ déclarent voter « oui ». Peut-on affirmer, au niveau $95\%$, que le « oui » est majoritaire dans la population ?

Étape 1 — fréquence. $f = \dfrac{520}{1000} = 0{,}52$.

Étape 2 — demi-largeur. $e = \dfrac{1}{\sqrt{1000}} \approx 0{,}0316$.

Étape 3 — intervalle. $I_C = [\,0{,}52 - 0{,}0316\,;\, 0{,}52 + 0{,}0316\,] \approx [\,0{,}488\,;\, 0{,}552\,]$.

Étape 4 — la vraie question, la subtilité. La barre de la majorité est $0{,}5$. Or $0{,}5$ appartient à $I_C$ : l'intervalle contient à la fois des valeurs sous $50\%$ et au-dessus. On ne peut donc pas conclure, au niveau $95\%$, que le « oui » est majoritaire, même si $f = 0{,}52 > 0{,}5$.

Ce que le correcteur attend. Que tu ne confondes pas $f > 0{,}5$ (vrai sur l'échantillon) avec « $p > 0{,}5$ » (non garanti). La conclusion se lit sur la position de $0{,}5$ par rapport à $I_C$, pas sur $f$ tout seul.

p (vraie proportion)rate pEnviron 95 % de ces intervalles contiennent p.

La check-list anti-pièges avant de rendre la copie

Relis ces quatre points, ils font gagner des points à tous les contrôles.

1. Variance ou écart-type ? Dans $\mathcal{N}(\mu,\,\sigma^2)$, le second paramètre est la variance. Si l'énoncé donne $\sigma^2 = 25$, alors $\sigma = 5$ — et c'est $\sigma$ (pas $25$) qui sert dans $\mu \pm k\sigma$.

2. La symétrie, à ne pas oublier. $P(X \ge \mu + a) = \dfrac{1 - P(\mu - a \le X \le \mu + a)}{2}$ : une queue vaut la moitié de ce qui reste, pas la totalité.

3. Fluctuation ou confiance ? Intervalle de fluctuation : $p$ connu, on encadre la fréquence $F_n$. Intervalle de confiance : $p$ inconnu, on l'estime à partir de $f$. Regarde toujours qui est connu.

4. Interprétation de l'IC. Une fois l'intervalle calculé, $p$ y est soit, soit pas — il n'y a plus de hasard. C'est le procédé qui réussit $95\%$ du temps, pas « cet intervalle-ci a $95\%$ de chances de contenir $p$ ». C'est la formulation exigée au bac.

Le contrôle est plié. Petit voyage vers l'année prochaine : d'où vient vraiment ce 95 %, pourquoi cette racine de n traîne partout, et où cette cloche va te resservir. Rien à réviser ici, juste de quoi voir plus loin.

Le secret des nombres : la loi normale centrée réduite

Le secret derrière $0{,}683$, $0{,}954$ et $1{,}96$. Ces nombres ne dépendent ni de $\mu$ ni de $\sigma$ ! C'est parce qu'on peut toujours se ramener à une seule loi de référence.

La standardisation. Si $X \sim \mathcal{N}(\mu,\,\sigma^2)$, alors la variable centrée réduite $Z = \dfrac{X - \mu}{\sigma}$ suit la loi normale centrée réduite $\mathcal{N}(0,\,1)$ : moyenne $0$, écart-type $1$. On « déplace » la cloche en $0$ et on la « remet à l'échelle » $1$.

Ce que ça éclaire. Le fameux $1{,}96$ est simplement le nombre tel que $P(-1{,}96 \le Z \le 1{,}96) = 0{,}95$ pour la loi $\mathcal{N}(0,\,1)$. En revenant à $X$ par $X = \mu + \sigma Z$, on retrouve $P(\mu - 1{,}96\,\sigma \le X \le \mu + 1{,}96\,\sigma) = 0{,}95$ : la même règle, pour n'importe quels $\mu$ et $\sigma$.

μN(μ, σ²)−101N(0, 1)Z = (X−μ)/σ

D'où sort le 1 sur racine de n ? Une idée de justification

Pourquoi cette demi-largeur $\dfrac{1}{\sqrt{n}}$ ? Elle vient d'un résultat plus fin sur la fluctuation d'une fréquence, qu'on majore ensuite pour obtenir une formule simple et sûre.

L'idée. Pour un échantillon de taille $n$, la théorie donne un intervalle à $95\%$ de la forme $f \pm 1{,}96\,\dfrac{\sqrt{f(1 - f)}}{\sqrt{n}}$. Le terme $\sqrt{f(1 - f)}$ dépend de $f$… mais on peut le borner.

La majoration clé. La quantité $f(1 - f)$ est maximale en $f = 0{,}5$, où elle vaut $0{,}25$. Donc $\sqrt{f(1 - f)} \le 0{,}5$, d'où $1{,}96\,\sqrt{f(1 - f)} \le 1{,}96 \times 0{,}5 = 0{,}98 \le 1$.

Conclusion. En remplaçant ce coefficient par $1$, on obtient un intervalle un peu plus large (donc au moins aussi sûr) : $I_C = \left[\,f - \dfrac{1}{\sqrt{n}}\,;\; f + \dfrac{1}{\sqrt{n}}\,\right]$. C'est exactement la formule du cours, et tu sais maintenant pourquoi elle « simplifie » sans jamais tricher sur les $95\%$.

Vers l'après-bac : où cette cloche va te resservir

Un pont vers d'autres notions du programme. La loi normale approche la loi binomiale quand $n$ est grand (une somme de nombreux tirages indépendants « devient » une cloche), et elle prolonge le chapitre concentration, loi des grands nombres : l'inégalité de Bienaymé-Tchebychev et la loi des grands nombres disent que la fréquence se concentre autour de $p$ quand $n$ grandit — l'intervalle de confiance en est la version chiffrée.

La règle du $\dfrac{1}{\sqrt{n}}$, à méditer. La précision d'un sondage est en $\dfrac{1}{\sqrt{n}}$ : pour diviser par deux la largeur de l'intervalle, il faut multiplier par quatre la taille de l'échantillon. C'est pour ça que les sondages « à $\pm 3\%$ » interrogent environ $1000$ personnes ($\dfrac{1}{\sqrt{1000}} \approx 0{,}032$).

Aperçu de l'après-bac. Le théorème central limite explique pourquoi la cloche est partout : la moyenne d'un grand nombre de variables indépendantes tend vers une loi normale, quelle que soit leur loi de départ. Dans le supérieur, ces intervalles deviennent la base de la statistique inférentielle et des tests d'hypothèse : décider, avec un risque contrôlé, si une différence observée est réelle ou due au hasard.