L'écart type : définition, calcul et interprétation en prépa

L'écart type mesure la dispersion autour de la moyenne. Définition, variance, formule de König-Huygens, exemples résolus et interprétation en prépa.

ViragePrépa

L'écart type est l'indicateur qui mesure à quel point les valeurs d'une série s'écartent de leur moyenne. Tu le calcules en deux temps : d'abord la variance, qui est la moyenne des carrés des écarts à la moyenne, puis sa racine carrée. Cette racine n'est pas un ornement. Elle ramène le résultat dans l'unité des données, ce qui rend le nombre lisible. Un écart type faible signale une série resserrée autour de sa moyenne. Un écart type élevé signale une série étalée. Tu le rencontres en statistique descriptive au lycée, puis sur les variables aléatoires en prépa, où il devient un outil de calcul et de raisonnement à part entière.

Ce que l'écart type mesure vraiment

La dispersion autour de la moyenne

Une série de données possède deux informations distinctes. La première est sa position : autour de quelle valeur les données se regroupent. La seconde est sa dispersion : à quelle distance de ce centre elles se trouvent.

La moyenne répond à la première question. L'écart type répond à la seconde. Il se lit comme une distance moyenne à la moyenne, exprimée dans la même unité que les données.

Si tu mesures des masses en kilogrammes, l'écart type est en kilogrammes. Si tu mesures des notes sur 20, il est en points. Cette propriété est ce qui le rend directement interprétable.

Pourquoi la moyenne seule ne suffit jamais

Prends deux groupes de huit copies. Le premier obtient 7, 9, 11, 12, 12, 14, 16 et 19. Le second obtient 12, 12, 12, 12, 13, 13, 13 et 13.

Les deux séries ont exactement la même moyenne, 12,5. Pourtant elles ne décrivent pas du tout la même classe. Le premier groupe est hétérogène, avec des copies très faibles et des copies très solides. Le second est d'une homogénéité frappante.

L'écart type sépare immédiatement ces deux situations. Il vaut environ 3,57 points dans le premier cas et 0,5 point dans le second. La moyenne, seule, aurait effacé cette différence.

Un indicateur parmi d'autres

L'écart type n'est pas le seul indicateur de dispersion. L'étendue, qui est la différence entre la plus grande et la plus petite valeur, en est un autre. L'écart interquartile en est un troisième.

Chacun a son usage. L'étendue est très sensible aux valeurs extrêmes. L'écart interquartile les ignore largement. L'écart type utilise toutes les données, avec un poids croissant selon l'éloignement. C'est à la fois sa force et sa limite.

Variance et écart type : les définitions et les formules

La variance comme moyenne des carrés des écarts

Soit une série de n valeurs x₁, x₂, …, xₙ, de moyenne notée x̄. La variance de la série s'écrit ainsi.

V = (1/n) × Σ (xᵢ − x̄)²

Dans cette formule, n est le nombre de valeurs et xᵢ la i-ième valeur observée. La moyenne arithmétique est notée x̄, et Σ désigne la somme pour i allant de 1 à n. La variance s'exprime dans l'unité des données élevée au carré.

Pourquoi des carrés et non des écarts bruts ? Parce que la somme des écarts simples est toujours nulle. Les écarts positifs compensent exactement les écarts négatifs. Le carré supprime les signes et conserve l'information de distance.

L'écart type comme racine carrée de la variance

L'écart type est défini comme la racine carrée de la variance.

σ = √V = √[(1/n) × Σ (xᵢ − x̄)²]

Ici σ, la lettre grecque sigma minuscule, désigne l'écart type de la série, V la variance, et les autres symboles gardent le sens déjà donné. L'écart type s'exprime dans l'unité des données, sans mise au carré.

La raison de cette racine est exactement là. La variance d'une série de masses en kilogrammes s'exprime en kilogrammes carrés, ce qui ne veut rien dire concrètement. La racine carrée annule la mise au carré et rend l'indicateur comparable aux données elles-mêmes. Tu peux alors écrire que la moyenne est de 50 kg avec un écart type de 5 kg, et la phrase a un sens physique.

Les notations à connaître

Les notations varient selon le contexte, et les confondre coûte des points. Pour une série statistique, l'écart type se note souvent σ et la variance σ² ou V.

Pour une variable aléatoire X, on écrit V(X) et σ(X). L'espérance E(X) joue le rôle de la moyenne. Pour un échantillon, on utilise plutôt s et s².

La formule de König-Huygens

L'énoncé

La définition directe impose de calculer la moyenne, puis de revenir sur chaque donnée pour en soustraire cette moyenne. La formule de König-Huygens évite ce double passage.

V = (1/n) × Σ xᵢ² − x̄²

Les symboles sont les mêmes que précédemment : Σ xᵢ² est la somme des carrés des valeurs, n le nombre de valeurs, x̄ la moyenne de la série. Autrement dit, la variance est la moyenne des carrés moins le carré de la moyenne.

Pour une variable aléatoire, la même identité s'écrit sous cette forme.

V(X) = E(X²) − [E(X)]²

Ici E(X²) est l'espérance du carré de X, et E(X) l'espérance de X. Les deux quantités s'expriment dans l'unité de X au carré.

Pourquoi elle est pratique

Son intérêt est purement calculatoire, et il est considérable. Elle permet de ne parcourir les données qu'une seule fois, en accumulant au passage la somme des valeurs et la somme de leurs carrés.

Elle évite aussi les soustractions répétées, souvent sources d'erreurs d'arithmétique en copie. Sur une variable aléatoire, elle transforme un calcul lourd en deux sommes élémentaires.

Une réserve existe en calcul numérique sur machine. Quand la moyenne est grande devant la dispersion, la différence de deux nombres proches perd en précision.

Une démonstration en trois lignes

Développe le carré dans la définition. Tu obtiens la somme des xᵢ², moins deux fois x̄ fois la somme des xᵢ, plus n fois x̄².

Or la somme des xᵢ vaut n x̄. Les deux derniers termes se regroupent donc en −n x̄².

Après division par n, il reste la moyenne des carrés moins le carré de la moyenne.

Population ou échantillon : le diviseur n ou n − 1

Deux questions différentes

Cette distinction est la source d'erreur la plus fréquente, et elle n'est pas une subtilité d'école. Tout dépend de ce que tu cherches à décrire.

Si tes n valeurs constituent l'ensemble complet que tu étudies, tu décris une population. Les notes des 42 élèves d'une classe, quand la classe est l'objet d'étude, forment une population. Le diviseur est alors n.

Si tes n valeurs sont un prélèvement dans un ensemble plus vaste, tu travailles sur un échantillon. Tu ne décris plus, tu estimes. Le diviseur devient n − 1.

La correction de Bessel

Le remplacement de n par n − 1 porte le nom de correction de Bessel. L'écart type d'échantillon s'écrit alors ainsi.

s = √[(1/(n − 1)) × Σ (xᵢ − x̄)²]

Dans cette expression, s est l'écart type corrigé de l'échantillon, n la taille de l'échantillon, xᵢ les valeurs observées et x̄ leur moyenne. L'unité reste celle des données.

La raison de cette correction est la suivante. La moyenne x̄ a été calculée sur l'échantillon lui-même, et non sur la population. Les données sont donc, par construction, un peu plus proches de x̄ qu'elles ne le sont de la vraie moyenne inconnue. Diviser par n sous-estimerait systématiquement la dispersion réelle. Le diviseur n − 1 compense ce biais, et rend la variance obtenue sans biais pour la variance de la population.

Ce que ta calculatrice affiche

Les calculatrices affichent très souvent les deux valeurs côte à côte. L'une est notée σx, σₙ ou xσn. L'autre est notée sx, σₙ₋₁ ou xσn-1.

La première correspond au diviseur n, la seconde au diviseur n − 1. Les tableurs, eux, proposent deux fonctions distinctes selon la même logique.

En copie, annonce ton choix. Une phrase suffit : précise si tu traites la série comme une population ou comme un échantillon.

Exemple entièrement résolu sur une série statistique

L'énoncé et la moyenne

Reprends la première série de copies : 7, 9, 11, 12, 12, 14, 16, 19. Il y a huit valeurs, donc n = 8.

La somme vaut 7 + 9 + 11 + 12 + 12 + 14 + 16 + 19, soit 100. La moyenne est donc x̄ = 100 ÷ 8 = 12,5 points.

Le calcul par la définition

Calcule les huit écarts à la moyenne. Ils valent −5,5 ; −3,5 ; −1,5 ; −0,5 ; −0,5 ; 1,5 ; 3,5 et 6,5.

Élève chacun au carré. Tu obtiens 30,25 ; 12,25 ; 2,25 ; 0,25 ; 0,25 ; 2,25 ; 12,25 et 42,25.

La somme de ces carrés vaut 102. La variance de population est donc V = 102 ÷ 8 = 12,75 points carrés. L'écart type vaut σ = √12,75, soit environ 3,57 points.

Le même calcul par König-Huygens

Somme directement les carrés des valeurs. Tu as 49 + 81 + 121 + 144 + 144 + 196 + 256 + 361, soit 1 352.

La moyenne des carrés vaut 1 352 ÷ 8 = 169. Le carré de la moyenne vaut 12,5², soit 156,25.

La variance est la différence : 169 − 156,25 = 12,75. Tu retrouves exactement la même valeur, en nettement moins d'opérations.

Et si c'était un échantillon

Suppose maintenant que ces huit copies soient un prélèvement au hasard dans un lot beaucoup plus large. Tu divises alors la somme des carrés des écarts par n − 1 = 7.

Tu obtiens s² = 102 ÷ 7, soit environ 14,57. L'écart type d'échantillon vaut s ≈ 3,82 points.

L'écart entre 3,57 et 3,82 n'est pas négligeable sur un petit effectif. Il devient marginal quand n est grand, puisque le rapport n ÷ (n − 1) tend vers 1.

Variance et écart type d'une variable aléatoire

Les définitions probabilistes

Le passage aux variables aléatoires conserve l'idée et change le vocabulaire. Soit X une variable aléatoire réelle admettant une espérance E(X). La variance se définit ainsi.

V(X) = E[(X − E(X))²]

Dans cette écriture, X est la variable aléatoire, E(X) son espérance, et V(X) la variance. L'écart type est σ(X) = √V(X), exprimé dans l'unité de X.

Pour une variable aléatoire finie prenant les valeurs x₁, …, xₙ avec les probabilités p₁, …, pₙ, le calcul devient une somme pondérée.

V(X) = Σ pᵢ × (xᵢ − E(X))²

Ici pᵢ est la probabilité que X prenne la valeur xᵢ, et la somme des pᵢ vaut 1. La variance est donc une moyenne des carrés des écarts, pondérée par les probabilités.

Exemple résolu sur une loi de probabilité

Soit X le nombre de questions de cours réussies lors d'une colle. Sa loi est donnée par P(X = 0) = 0,1 ; P(X = 1) = 0,3 ; P(X = 2) = 0,4 ; P(X = 3) = 0,2. La somme des probabilités vaut bien 1.

Calcule d'abord l'espérance. E(X) = 0 × 0,1 + 1 × 0,3 + 2 × 0,4 + 3 × 0,2, soit 0 + 0,3 + 0,8 + 0,6 = 1,7.

Calcule ensuite l'espérance du carré. E(X²) = 0² × 0,1 + 1² × 0,3 + 2² × 0,4 + 3² × 0,2, soit 0 + 0,3 + 1,6 + 1,8 = 3,7.

Applique König-Huygens. V(X) = 3,7 − 1,7², soit 3,7 − 2,89 = 0,81. L'écart type vaut σ(X) = √0,81 = 0,9 question.

Vérifie par la définition directe. Les écarts à 1,7 valent −1,7 ; −0,7 ; 0,3 et 1,3, et la somme pondérée de leurs carrés redonne bien 0,81.

Comportement sous transformation affine

Soit a et b deux réels, et Y = aX + b. L'espérance est linéaire, donc E(Y) = a E(X) + b. La variance, elle, ne l'est pas.

V(aX + b) = a² × V(X)

Dans cette formule, a est le coefficient multiplicatif, b la constante additive, et V(X) la variance de X. L'écart type suit la règle σ(aX + b) = |a| × σ(X), avec la valeur absolue de a.

Retiens les deux conséquences. Ajouter une constante ne change pas la dispersion, puisque tout le nuage se translate en bloc. Multiplier par a dilate la dispersion d'un facteur |a|.

Sur l'exemple précédent, pose Y = 5X + 2. Alors E(Y) = 5 × 1,7 + 2 = 10,5, puis V(Y) = 25 × 0,81 = 20,25 et σ(Y) = 4,5.

Variance d'une somme de variables indépendantes

Si X et Y sont indépendantes et admettent une variance, les variances s'ajoutent.

V(X + Y) = V(X) + V(Y)

Dans cette égalité, V(X) et V(Y) sont les variances respectives, et l'indépendance est l'hypothèse indispensable. Sans elle, un terme de covariance apparaît : V(X + Y) = V(X) + V(Y) + 2 Cov(X, Y).

Attention au piège central. Ce sont les variances qui s'ajoutent, jamais les écarts types. L'écart type d'une somme de n variables indépendantes de même loi croît comme √n, pas comme n.

Cette propriété donne directement la variance de la loi binomiale. Si X suit la loi binomiale de paramètres n et p, alors V(X) = n p (1 − p) et σ(X) = √[n p (1 − p)]. Pour n = 100 et p = 0,5, l'écart type vaut √25, soit 5.

Toutes les formules selon le contexte

Le tableau récapitulatif

Contexte

Variance

Écart type

Remarque

Série, population entière

V = (1/n) Σ (xᵢ − x̄)²

σ = √V

diviseur n

Série, échantillon

s² = (1/(n−1)) Σ (xᵢ − x̄)²

s = √s²

correction de Bessel

Série, forme König-Huygens

V = (1/n) Σ xᵢ² − x̄²

σ = √V

un seul parcours des données

Série pondérée par effectifs

V = (1/N) Σ nᵢ (xᵢ − x̄)²

σ = √V

N = Σ nᵢ

Variable aléatoire, définition

V(X) = E[(X − E(X))²]

σ(X) = √V(X)

unité de X

Variable aléatoire, König-Huygens

V(X) = E(X²) − [E(X)]²

σ(X) = √V(X)

calcul le plus rapide

Transformation affine

V(aX + b) = a² V(X)

σ(aX + b) = |a| σ(X)

b n'intervient pas

Somme, variables indépendantes

V(X + Y) = V(X) + V(Y)

σ = √[V(X) + V(Y)]

indépendance requise

Loi binomiale de paramètres n et p

V(X) = n p (1 − p)

σ(X) = √[n p (1 − p)]

p ∈ [0 ; 1]

Loi uniforme sur {1, …, n}

V(X) = (n² − 1)/12

σ(X) = √[(n² − 1)/12]

dé à six faces : σ ≈ 1,71

Le lien avec la loi normale

La loi normale donne à l'écart type une lecture particulièrement parlante. Elle est entièrement déterminée par deux paramètres : son espérance μ, qui fixe le centre, et son écart type σ, qui fixe l'étalement.

Pour une variable normale, les proportions autour de la moyenne sont fixes. L'intervalle [μ − σ ; μ + σ] contient environ 68,3 % des valeurs. Celui à 2σ en contient environ 95,4 %. Celui à 3σ en contient environ 99,7 %.

Ces trois repères sont souvent résumés par la suite 68, 95, 99,7. Pour obtenir exactement 95 %, le bon coefficient est 1,96 et non 2, ce qui explique la présence récurrente de 1,96 dans les intervalles de confiance.

Ces proportions ne valent que sous hypothèse de normalité. Sur une distribution très asymétrique ou à queues lourdes, elles ne s'appliquent pas. La seule borne valable sans hypothèse de forme est l'inégalité de Bienaymé-Tchebychev, qui garantit que la proportion de valeurs au-delà de k écarts types est inférieure ou égale à 1/k².

Le coefficient de variation

Un écart type ne se compare pas d'une série à l'autre quand les unités ou les ordres de grandeur diffèrent. Le coefficient de variation répond à ce besoin.

CV = σ ÷ x̄

Ici σ est l'écart type de la série et x̄ sa moyenne. Le rapport est sans unité, et s'exprime fréquemment en pourcentage.

Un exemple rend l'intérêt visible. Une série de masses de moyenne 50 kg et d'écart type 5 kg a un coefficient de variation de 10 %. Une série de prix de moyenne 200 € et d'écart type 40 € a un coefficient de 20 %. La seconde série est donc relativement plus dispersée, malgré un écart type huit fois plus grand en valeur brute.

Ce coefficient perd tout sens quand la moyenne est nulle ou proche de zéro, et quand les données peuvent être négatives. Il s'emploie sur des grandeurs positives.

Les erreurs d'interprétation les plus fréquentes

Confondre écart type et écart moyen

L'écart type n'est pas la moyenne des distances à la moyenne. Cette dernière quantité existe, s'appelle écart absolu moyen, et vaut en général moins que l'écart type.

Sur la série de copies traitée plus haut, l'écart absolu moyen vaut 2,875 points, contre 3,57 pour l'écart type. L'écart type est plus grand parce que la mise au carré accorde un poids supérieur aux valeurs éloignées.

Les deux indicateurs répondent à la même intuition, sans donner les mêmes nombres.

Additionner des écarts types

C'est l'erreur la plus coûteuse en concours. Les écarts types ne s'additionnent pas, même sous indépendance.

Si deux variables indépendantes ont chacune un écart type de 3, la somme n'a pas un écart type de 6. Sa variance vaut 9 + 9 = 18, donc son écart type vaut √18, soit environ 4,24.

La règle à mémoriser tient en une phrase. On passe toujours par les variances pour additionner, puis on prend la racine à la fin.

Lire un écart type sans sa moyenne

Un écart type isolé ne dit rien. Un écart type de 3 est énorme sur des notes resserrées autour de 15. Il est modeste sur des revenus mensuels exprimés en milliers d'euros.

L'écart type se lit toujours relativement à la moyenne, à l'unité, et à l'ordre de grandeur des données. Le coefficient de variation formalise cette lecture relative.

Trois autres confusions reviennent souvent. L'écart type n'est pas l'erreur de mesure. Il n'est pas l'écart type de la moyenne, qui vaut σ ÷ √n pour un échantillon de taille n. Et il n'indique rien sur la forme de la distribution : deux séries d'écart type identique peuvent être symétriques ou très asymétriques.

La place de la notion au programme et aux concours

Du lycée à la prépa

Les indicateurs de dispersion apparaissent dès le lycée dans les programmes de mathématiques publiés par le ministère au Bulletin officiel. La moyenne et l'écart type d'une série statistique relèvent de la statistique descriptive. La variance et l'écart type d'une variable aléatoire discrète finie, avec la formule de König-Huygens, relèvent ensuite de l'enseignement de spécialité.

En classe préparatoire, la notion est reprise sur les variables aléatoires dans le cadre des programmes des filières scientifiques et économiques. Le détail de ce qui est exigible varie selon la filière, MPSI, PCSI, PTSI, MP2I, BCPST ou ECG, et selon l'année.

Pour connaître le périmètre exact qui s'applique à toi, le document de référence est le programme officiel de ta filière, publié au Bulletin officiel et accessible sur les pages du ministère chargé de l'enseignement supérieur. C'est la seule source à consulter pour trancher une question d'exigibilité.

Ce que les épreuves attendent

Les attendus sont stables d'une filière à l'autre. Tu dois savoir calculer une variance et un écart type sur une série comme sur une loi, par les deux méthodes. Tu dois connaître le comportement sous transformation affine, et la variance d'une somme de variables indépendantes.

En colle, l'oral porte souvent sur l'interprétation plutôt que sur le calcul. Explique ce que mesure l'écart type, pourquoi on prend la racine, et pourquoi le diviseur change entre population et échantillon. Ces trois réponses valent beaucoup de points.

FAQ

La variance est la moyenne des carrés des écarts à la moyenne. L'écart type est sa racine carrée. Les deux mesurent la même chose, la dispersion, mais pas dans la même unité. La variance s'exprime dans l'unité des données au carré, ce qui la rend peu lisible. L'écart type s'exprime dans l'unité des données, ce qui permet de l'interpréter directement. En pratique, on calcule la variance et on communique l'écart type.

Pour revenir à l'unité des données. Les écarts sont élevés au carré afin d'empêcher les écarts positifs et négatifs de s'annuler. Cette mise au carré transforme des kilogrammes en kilogrammes carrés, ce qui n'a pas d'interprétation concrète. La racine carrée annule cette opération. Tu peux alors dire qu'une série de masses a une moyenne de 50 kg et un écart type de 5 kg, et la phrase se comprend immédiatement.

Cela dépend de ton objectif. Si les données constituent la totalité de l'ensemble étudié, tu décris une population et tu divises par n. Si elles forment un prélèvement destiné à estimer la dispersion d'un ensemble plus large, tu divises par n − 1. Cette correction, dite de Bessel, compense le fait que la moyenne a été calculée sur l'échantillon lui-même. En copie, précise toujours lequel des deux cas tu traites.

C'est l'identité qui exprime la variance comme la moyenne des carrés moins le carré de la moyenne. Sur une série, elle s'écrit V = (1/n) Σ xᵢ² − x̄². Sur une variable aléatoire, elle s'écrit V(X) = E(X²) − [E(X)]². Son intérêt est pratique : un seul parcours des données suffit, et les soustractions répétées disparaissent. Elle réduit nettement le risque d'erreur de calcul dans une copie.

Non, jamais. C'est une racine carrée d'une somme de carrés divisée par un entier positif, donc une quantité positive ou nulle. Un écart type nul signifie que toutes les valeurs de la série sont identiques, puisque chaque écart à la moyenne est alors nul. Si ton calcul aboutit à un nombre négatif, c'est une erreur d'arithmétique, le plus souvent une inversion dans la formule de König-Huygens.

Par le coefficient de variation, défini comme le rapport de l'écart type à la moyenne. Ce rapport est sans unité, donc comparable d'une série à l'autre. Une série de moyenne 50 et d'écart type 5 a un coefficient de 10 %. Une série de moyenne 200 et d'écart type 40 a un coefficient de 20 %, donc une dispersion relative supérieure. Ce coefficient suppose des données positives et une moyenne non nulle.

Non. Ce sont les variances qui s'additionnent, et seulement sous hypothèse d'indépendance. Pour deux variables indépendantes d'écart type 3 chacune, la variance de la somme vaut 9 + 9 = 18, et l'écart type vaut √18, soit environ 4,24. Sans indépendance, un terme de covariance s'ajoute. Cette confusion revient très régulièrement dans les copies de concours et se corrige par un réflexe simple : additionner les variances, prendre la racine à la fin.

Pour une loi normale d'espérance μ et d'écart type σ, l'intervalle [μ − σ ; μ + σ] contient environ 68,3 % des valeurs. L'intervalle à 2σ en contient environ 95,4 %, celui à 3σ environ 99,7 %. Ces repères ne valent que sous hypothèse de normalité. Sans hypothèse sur la forme de la distribution, seule l'inégalité de Bienaymé-Tchebychev donne une majoration, en 1/k² au-delà de k écarts types.

Refais le calcul par l'autre méthode. Si tu as utilisé la définition, recommence avec König-Huygens, et inversement. Les deux doivent donner le même nombre. Contrôle aussi l'ordre de grandeur : l'écart type est forcément inférieur à l'étendue de la série, et il est en général du même ordre que les écarts typiques que tu lis à l'œil. Enfin, vérifie l'unité, qui doit être celle des données.

Conclusion

L'écart type tient en une idée simple. Il mesure, dans l'unité des données, à quelle distance de la moyenne les valeurs se tiennent. Tout le reste découle de cette phrase.

Le chemin de calcul est également court. Tu calcules la variance, le plus souvent par König-Huygens, puis tu prends la racine carrée. Quatre points font ensuite la différence en copie. Le choix du diviseur, le facteur a² sous transformation affine, l'additivité des variances sous indépendance, et la lecture de l'écart type au regard de la moyenne.

Ces automatismes se construisent par la répétition sur des séries et sur des lois, jusqu'à ce que l'interprétation vienne aussi vite que le calcul. Travaille tes concours avec un mentor et transforme ces connaissances en points, avec ViragePrépa.

À ne pas manquer

Débouchés de la prépa scientifique : écoles, ENS, métiersDébouchés de la prépa ECG : écoles, métiers et salairesConcours Centrale-Supélec : épreuves et préparationLa courbe de l'éléphant : qui a gagné à la mondialisation ?
DIAGNOSTIC GRATUIT

Cet article vous concerne ? Parlons-en 15 minutes.

On analyse la situation de l'élève et on vous dit franchement où il peut viser. Gratuit · Sans engagement · 7j/7