Dispersion et écart

The centre is one number; spread says how far the data live from it.

Chargement de la simulation interactive...

Une estimation coûte un degré de liberté 🖖

La moyenne de l'échantillon est le seul nombre qui rend la somme des carrés des écarts aussi petite que possible. Ainsi, un échantillon mesuré autour de sa propre moyenne donne toujours un total inférieur à ce même échantillon mesuré autour de la moyenne de la population, que vous ne pouvez pas voir, et la division par n hérite de ce déficit. Dans l'expérience ci-dessus, des échantillons de cinq éléments laissent le diviseur n trop faible d'environ un cinquième, et son résultat s'avère trop bas à chaque tirage plutôt qu'en moyenne. Diviser par n − 1 est le facteur qui compense cette perte.

L’écart-type n’est pas la distance moyenne 🖖

Élever les écarts au carré, en faire la moyenne, puis extraire la racine n'est pas la même opération que calculer la moyenne des distances. En effet, la mise au carré fait qu'une valeur deux fois plus éloignée de la moyenne compte quatre fois plus. Cette différence va toujours dans le même sens. L'écart-type n'est jamais inférieur à l'écart absolu moyen, quelle que soit la liste de nombres, et ces deux mesures ne sont égales que si chaque valeur se trouve à la même distance de la moyenne. Les notes de la classe affichent 2,55 et 2,00. Le préréglage comportant une valeur aberrante, qui charge le diviseur de l'échantillon, indique 5,15 et 3,13.

L’IQR ignore volontairement les extrêmes 🖖

L'écart interquartile élimine le quart inférieur et le quart supérieur des données avant de mesurer quoi que ce soit, ce qui le rend précisément insensible à une valeur aberrante. Cela le rend également aveugle. Sur cette page, le groupe resserré et le préréglage comportant une valeur aberrante affichent tous deux un écart interquartile de 2,00, tandis que leurs écarts-types s'élèvent respectivement à 1,22 et 5,15. À lui seul, un écart interquartile ne vous dit rien sur l'étendue réelle de vos données.

Problème entièrement résolu

  1. L'aberrance manifeste qu'une règle des trois sigmas ne peut pas signaler 9 étapes

    Le préréglage à une valeur aberrante contient sept valeurs entre 4 et 7 et une à 20. Calculez le score z de cette dernière à partir de l'écart type d'échantillon, puis décidez si une règle qui signale tout ce qui dépasse trois écarts types aurait jamais pu l'attraper.

    1. Additionnez les huit valeurs et répartissez-les : 60 sur 8 font 7,50. Sept des huit se trouvent en dessous, si bien que l'unique valeur haute déplace déjà le centre avant même de toucher à la dispersion.

    2. Retranchez 7,50 de chacune. Les sept valeurs serrées tombent entre 0,5 et 3,5 d'écart ; la huitième est à 12,5. Le panneau imprime cette colonne, et elle s'annule, comme toute colonne d'écarts.

    3. L'élévation au carré rend le total dissymétrique. Les sept réunies apportent 29,75, et la valeur 20 en apporte 156,25 à elle seule, plus de cinq fois le reste de l'échantillon. C'est exactement le travail pour lequel le carré est là.

    4. Ce préréglage charge le mode échantillon, donc le diviseur est 7 et non 8. Le panneau imprime la fraction en plus du résultat : 186,00 sur 7 donne une variance de 26,57 et un écart type de 5,15. Poussez la division d'un rang de plus et s vaut 5,1547, ce dont l'étape suivante a besoin.

    5. Un score z compte les écarts types depuis la moyenne, donc ici 12,5 sur 5,1547, soit 2,4249. La valeur la plus voyante du jeu n'atteint pas trois, et elle n'en est même pas proche.

    6. Reste à savoir si c'est un fait sur cette liste ou sur huit nombres en général. Une seule chose en décide : les écarts s'annulent, donc quels que soient les sept autres, leur somme vaut exactement l'opposé du huitième.

    7. Des nombres de somme fixée ont la plus petite somme de carrés possible lorsqu'ils sont tous égaux. Les sept écarts restants ne peuvent donc pas être tous petits : au plus économe, ils se partagent la charge à parts égales, ce qui pose un plancher sous le total des carrés.

    8. Un plancher sous le total des carrés est un plancher sous s, et un plancher sous s est un plafond sur z. Aucune valeur d'une liste de n ne peut se tenir à plus de (n − 1)/√n écarts types d'échantillon de la moyenne. À n = 8, ce plafond vaut 2,4749. Portez le 20 à 100 : le panneau donne un écart de 82,50 contre un écart type de 33,35, donc z vaut 2,474. Portez-le à un million et z atteint 2,4749 à quatre décimales, et il s'y arrête.

    9. Le plafond dépend de n et de rien d'autre, et il dépasse 3 pour la première fois à onze valeurs : dix peuvent atteindre 2,846, onze peuvent atteindre 3,015. La liste en accepte douze, le cas extrême est donc à portée. Saisissez dix zéros et un 1000, toujours en mode échantillon. Le panneau donne une moyenne de 90,91 et un écart type de 301,51, et le plus grand écart, 909,09, divisé par 301,51 vaut 3,015, c'est-à-dire le plafond lui-même.

    Réponse

    z = 2,42, et aucune règle des trois sigmas n'aurait pu le signaler, parce que huit nombres ne peuvent pas produire un z de 3, si extrême que soit l'un d'eux.

    La règle n'était pas tant fausse ici qu'inutilisable, et c'est ce qu'il faut retenir. Un seuil écrit en écarts types est autant une affirmation sur la taille de l'échantillon que sur la valeur testée, puisque cette valeur est à l'intérieur de l'écart type qui sert à la mesurer. Trois écarts types réclament au moins 11 observations avant d'être seulement atteignables, quatre en réclament 18, et en dessous de ces tailles un échantillon contaminé ressemble exactement à un échantillon propre aux yeux du test. Quelque chose qui fonctionne sur huit nombres est déjà sur cette page. La clôture de Tukey place la limite à Q3 + 1,5 × IQR ; le panneau donne Q3 = 7,00 et IQR = 2,00, la clôture se dresse donc à 10 et la valeur 20 se trouve bien au-delà. Les quartiles sont des positions dans la liste triée plutôt que des moyennes de celle-ci, et c'est pourquoi le point jugé ne peut pas déplacer la règle graduée.

Parcours

Un nombre pour plusieurs : statistiques résumées

Exemples de problèmes

  • classroom scores - Huit notes d'examen allant de 4 à 13. Lisez la colonne centrale de haut en bas et vous constaterez que les écarts s'annulent. C'est pourquoi la troisième colonne les élève d'abord au carré. Ces carrés totalisent 52,00, ce qui sur n = 8 donne une variance de 6,50, un écart-type de 2,55 et un écart moyen absolu de 2,00.
  • tight cluster - Huit mesures comprises entre 48,00 et 52,00. La dispersion ne se soucie pas de l'ampleur des nombres, mais seulement de la distance qui les sépare : les écarts au carré atteignent 12,00 et l'écart-type s'établit à 1,22, face à un écart moyen absolu de 1,00. Chargez ensuite le préréglage avec la valeur aberrante et observez ces deux indicateurs s'éloigner l'un de l'autre.
  • one outlier - Sept valeurs se concentrent entre 4 et 7, et une seule s'isole à 20. Ce point unique fournit 156,25 sur le total de 186,00 dans la colonne des carrés, si bien que l'écart-type grimpe à 5,15 tandis que l'écart moyen absolu s'arrête à 3,13. L'écart interquartile ne la remarque même pas : Q1 et Q3 valent 5,00 et 7,00, il reste donc à 2,00, peu importe jusqu'où s'égare cette dernière valeur. C'est l'unique préréglage qui applique le diviseur d'échantillon.