Leçon
La théorie — Test F ANOVA
Une ANOVA à un facteur ne demande pas si plusieurs moyennes de groupes diffèrent — des moyennes mesurées diffèrent toujours un peu. Elle demande si elles diffèrent plus que le simple hasard d’échantillonnage ne le produirait. La statistique F rend cela comparable en plaçant la dispersion entre les moyennes de groupes sur la dispersion à l’intérieur des groupes, et la valeur p dit à quelle fréquence le hasard seul atteindrait un rapport aussi grand.
Ce que signifie chaque symbole
MS_between- le carré moyen intergroupes : à quelle distance les moyennes de groupes se trouvent de la moyenne générale, par degré de liberté.
MS_within- le carré moyen intragroupes : la dispersion ordinaire des observations autour de la moyenne de leur propre groupe. C’est l’étalon.
F- leur rapport. Autour de 1 quand les groupes se ressemblent, car les deux estiment alors la même chose.
p- la probabilité que des groupes réellement identiques produisent un F au moins aussi grand.
D’où vient la formule
- Supposons un instant que tous les groupes aient la même moyenne. Alors les observations sont toutes tirées d’une seule population, et il existe deux façons indépendantes d’estimer la variance de cette population à partir de vos données.
- La première ignore complètement le regroupement et mesure seulement la dispersion à l’intérieur de chaque groupe : c’est
MS_within. Elle estime la variance de la population que les moyennes diffèrent ou non, et c’est ce qui en fait un étalon honnête. - La seconde n’utilise que les moyennes de groupes. Si les groupes sont réellement identiques, les moyennes s’écartent quand même les unes des autres par pur échantillonnage, et l’ampleur de ce frémissement est elle-même une estimation de la même variance : c’est
MS_between. Si les moyennes ne sont pas identiques, cette seconde estimation est gonflée en plus par les écarts réels. - Le rapport
F = MS_between / MS_withinoppose donc une estimation qui grandit quand les moyennes diffèrent à une estimation qui ne le fait pas. Sous « toutes les moyennes égales », il devrait tomber près de 1 et suit une loi connue — la courbe tracée ci-dessus, entièrement fixée par les deux degrés de liberté. La valeur p est l’aire de cette courbe à droite de votre F.
Comment lire ce que vous voyez
La courbe bleue est ce que ferait F si toutes les moyennes de groupes étaient identiques ; elle ne dépend que des deux degrés de liberté — pas de vos données. La queue ombrée en rouge est la région de rejet : les valeurs si éloignées qu’elles surviendraient par hasard moins de α du temps, la ligne pointillée à la valeur critique marquant le début. La ligne verte indique où votre F est réellement tombé. Tout le test tient à savoir de quel côté de la ligne pointillée se trouve la verte, et la valeur p est l’aire à droite de celle-ci.
- Suppose
- Des observations indépendantes les unes des autres, approximativement normales dans chaque groupe et — celle qui mord — des variances approximativement égales d’un groupe à l’autre. Cette page part des deux carrés moyens et non de vos données : elle ne peut donc vérifier aucune des trois pour vous. Elle calculera volontiers une valeur p à l’air assuré à partir de n’importe quel couple de nombres positifs.
- Ne tient plus quand
- L’égalité des variances est l’endroit où cela dérape en silence.
MS_withinmet en commun la dispersion de tous les groupes en un seul étalon, et si un groupe est bien plus variable que les autres, cet étalon n’en décrit aucun ; la statistique ne suit plus la courbe ci-dessus et la valeur p mesure une aire sous la mauvaise loi. Le remède habituel est l’ANOVA de Welch, qui ne met rien en commun. Des effectifs inégaux aggravent le même problème, car l’estimation groupée est alors dominée par le groupe le plus nombreux.
Problème entièrement résolu
-
Trois groupes, trente observations et un F de 1,33 5 étapes
Trois groupes, trente observations et un F de 1,33 non significatif. Déterminez d'où viennent ces degrés de liberté, et pourquoi vous ne pouvez pas simplement effectuer trois tests t à la place.
-
La statistique F est le rapport de deux estimations de la variance : la différence entre les moyennes des groupes divisée par la dispersion des observations au sein des groupes. Une valeur proche de 1 indique que les groupes diffèrent à peu près autant que ce que le seul hasard produirait.
-
Les degrés de liberté vous indiquent le plan d'expérience sans qu'on vous le dise. Le premier est le nombre de groupes moins un, il y a donc trois groupes ; le second est le nombre total d'observations moins le nombre de groupes, il y a donc trente observations.
-
En multipliant chaque carré moyen par ses degrés de liberté, on retrouve les sommes des carrés — 8 intergroupes et 81 intragroupes, soit 89 au total.
-
Leur rapport est l'éta-carré, la part de la variation totale expliquée par le regroupement. Neuf pour cent.
-
L'alternative consiste à comparer les trois groupes deux à deux, ce qui revient à effectuer trois tests t. Chacun comporte un taux de faux positifs de 5 %, de sorte que le risque d'avoir au moins une fausse alerte est de 1 − 0,95³.
Réponse
L'outil affiche F = 1,3333, des degrés de liberté (2, 27) et η² = 0,0899. Il en découle deux choses. Premièrement, la taille de l'effet n'est pas nulle — le regroupement explique bien 9 % de la variation —, mais avec une telle dispersion intragroupe, cela n'a rien de remarquable, ce qui est exactement le sens d'un F non significatif et précisément ce que l'on oublie lorsqu'on l'interprète comme une « absence de différence ». Deuxièmement, la raison d'être de l'ANOVA : trois tests t deux à deux comportent un risque de 14,3 % d'obtenir au moins un faux positif, contre les 5 % que vous pensiez acheter, et avec cinq groupes, cela représente dix tests et 40 %. Effectuer un seul test sur l'ensemble des groupes à la fois est la solution.
-
Parcours
Quand une différence est-elle réelle ?
Références (3)
- The paper that introduced the word “variance” and the decomposition the lesson derives: R. A. Fisher, "The Correlation between Relatives on the Supposition of Mendelian Inheritance." Transactions of the Royal Society of Edinburgh 52(2), 399–433, 1919 (read 1918).
- The repair when the groups do not share a variance, which is the assumption this page cannot check for you: B. L. Welch, "On the Comparison of Several Mean Values: An Alternative Approach." Biometrika 38(3/4), 330–336, 1951.
- Where small-sample testing came from, and why a RATIO of variances was the right thing to look at: G. E. P. Box, "Guinness, Gosset, Fisher, and Small Samples." Statistical Science 2(1), 45–52, 1987.