レッスン
理論 — ANOVA F検定
一元配置分散分析が問うのは、複数の群平均が違うかどうかではありません。測った平均はいつだって少しは違います。問うのは、無作為抽出だけで生じる程度を超えて違うかどうかです。F 統計量は、群平均どうしのばらつきを群の中のばらつきで割ることでそれを比較可能にし、p 値は、偶然だけでそれほど大きな比がどのくらいの頻度で生じるかを告げます。
各記号の意味
MS_between- 群間平均平方。群平均が全体平均からどれだけ離れているかを、自由度あたりで表したもの。
MS_within- 群内平均平方。観測値が自分の群の平均のまわりに散らばる、ふつうのばらつき。これがものさしです。
F- 両者の比。群が似ていれば 1 前後になります。そのとき二つは同じものを推定しているからです。
p- 本当に同一の群が、これ以上に大きい F を生む確率。
公式の導き方
- ひとまず、すべての群の平均が同じだと仮定します。すると観測値はすべて一つの母集団からの抽出であり、手元のデータからその母分散を推定する独立な方法が二つ存在します。
- 一つ目は群分けを完全に無視し、各群の内部のばらつきだけを測ります。これが
MS_withinです。平均が違っていようといまいと母分散を推定するので、公平なものさしになります。 - 二つ目は群平均だけを使います。群が本当に同一でも、平均は抽出のゆらぎだけで互いに離れます。そのゆらぎの大きさ自体が同じ母分散の推定量であり、これが
MS_betweenです。平均が同一でない場合、この二つ目の推定量は、抽出のゆらぎの上に本物の差が上乗せされて膨らみます。 - つまり比
F = MS_between / MS_withinは、平均が違えば大きくなる推定量を、そうならない推定量と突き合わせています。「すべての平均が等しい」なら 1 の近くに落ち、既知の分布 —— 上に描かれた、二つの自由度だけで完全に決まる曲線 —— に従います。p 値は、その曲線のうちあなたの F より右側の面積です。
表示の読み方
青い曲線は、すべての群平均が同一だったときに F がとる姿で、二つの自由度以外の何にも依存しません。あなたのデータにも依存しません。赤く塗られた裾が棄却域で、偶然に起きる確率が α 未満になるほど外側の値です。破線が臨界値、つまりその始まりを示します。緑の線は、あなたの F が実際に落ちた場所です。検定の全体は、破線のどちら側に緑の線があるかという問いに尽き、p 値はその右側の面積です。
- 前提
- 観測値が互いに独立であること、各群の中でおおむね正規分布であること、そして —— これが厄介です —— 群をまたいで分散がおおむね等しいこと。このページはあなたのデータではなく二つの平均平方から始まるので、三つのどれも代わりに確かめることができません。正の数を二つ入れれば、いかにも自信ありげな p 値を平気で計算します。
- 成り立たない場合
- 静かに壊れるのは等分散の仮定です。
MS_withinは全群のばらつきを一本のものさしにまとめますが、一つの群だけが飛び抜けてばらついていれば、そのものさしはどの群も表していません。統計量は上の曲線に従わなくなり、p 値は誤った分布のもとで面積を測っていることになります。通常の対処は、まとめないウェルチの分散分析です。群のサイズが不揃いだと同じ問題は悪化します。まとめた推定量が、たまたま最大の群に支配されてしまうからです。
全プロセスの詳細解説
-
3つのグループ、30の観測値、および1.33のF値 5 ステップ
3つのグループ、30の観測値、そして有意ではない1.33のF値。それらの自由度がどこから生じるのかを導き出し、なぜ単に3回のt検定を実行するだけでは済まないのかを解き明かせ。
-
F統計量は2つの分散推定値の比である。すなわち、グループの平均値がどれだけ離れているかを、グループ内で観測値がどれだけばらついているかで割ったものである。1に近い値は、偶然だけによって生じる程度にしかグループ間に差がないことを意味する。
-
自由度は、告げられずとも実験の構成を教えてくれる。第1の自由度はグループ数マイナス1であるためグループ数は3であり、第2の自由度は全観測値数マイナスグループ数であるため観測値数は30である。
-
各平均平方にそれぞれの自由度を掛けると平方和が復元される――群間が8、群内が81、合計で89である。
-
それらの比がエータ二乗(η²)であり、全体の変動のうちグループ分けが説明する割合を表す。9%である。
-
これに代わる方法は3つのグループを2群ずつ対比較することであり、これは3回のt検定に相当する。それぞれが5%の偽陽性率を伴うため、少なくとも1つの誤警報が生じる確率は 1 − 0.95³ となる。
解答
ツールには、F = 1.3333、自由度(2, 27)、およびη² = 0.0899と表示される。ここから2つのことが導かれる。第1に、効果量はゼロではない――グループ分けは確かに変動の9%を説明している――が、これほど大きな群内ばらつきのもとでは特筆すべきものではない。これこそが有意でないF値が意味することであり、結果を「差がない」と読み取るときに人々が見落としがちな点である。第2に、分散分析が存在する理由である。3回の対比較のt検定は、想定していた5%に対して少なくとも1つの偽陽性が生じる確率が14.3%に達し、5グループでは10回の検定となり40%に達する。全グループを一括して1回の検定で行うことがその解決策である。
-
学習の道すじ
データの「差」はいつ本物になるのか
参考文献 (3)
- The paper that introduced the word “variance” and the decomposition the lesson derives: R. A. Fisher, "The Correlation between Relatives on the Supposition of Mendelian Inheritance." Transactions of the Royal Society of Edinburgh 52(2), 399–433, 1919 (read 1918).
- The repair when the groups do not share a variance, which is the assumption this page cannot check for you: B. L. Welch, "On the Comparison of Several Mean Values: An Alternative Approach." Biometrika 38(3/4), 330–336, 1951.
- Where small-sample testing came from, and why a RATIO of variances was the right thing to look at: G. E. P. Box, "Guinness, Gosset, Fisher, and Small Samples." Statistical Science 2(1), 45–52, 1987.