これは機械翻訳であり、原文は英語です。 原文を読む
何もないデータに対して20回のテストを行えば、そのうちの1つは有意になります
実際のデータに対する1回のテストで p = 0.0002982 が得られます。純粋なノイズに対する20回のテストは、ニュースの見出しになるような結果を生み出します。
t-test tool を初期設定で開いてみましょう。仮説値 72 に対し、サンプルサイズ 30、平均 78、標準偏差 8 のデータが設定されています。自由度 29 で t = 4.1079、そして p = 0.0002982 と出力されます。これは、仮に実際の差が全く存在しない場合に、これほど大きな差が見られる確率が 10,000 分の 3 しかないことを示しています。帰無仮説を棄却し、その結論に十分な確信を持つことができます。
ここで α = 0.05 に設定し、この閾値が実際に何を約束しているのかを考えてみましょう。
約束はテスト単体に対するものである
α = 0.05 という設定は、帰無仮説が真である場合、このテストが 5% の確率で誤って帰無仮説を棄却することを意味します。
何の差も含まれていないデータに対して、独立した 20 回のテストを実行したとします。個々のテストは正常に挙動します。それぞれが正しく『何も存在しない』と判定する確率は 95% です。しかし、20 回すべてが正常に挙動する確率は、
0.9520 = 0.358
したがって、少なくとも 1 つが誤警報を発する確率は 64.2% となります。これは単なるリスクではなく、むしろ起こり得る結果です。純粋なノイズに対して 20 回のテストを行えば、大半の場合で有意な結果が得られます。そしてその有意な結果は、0.05 未満の p 値、ゼロを含まない信頼区間、その他本物の発見が見せるあらゆる特徴を備えています。なぜなら、本物の発見と見た目上区別がつかないからです。
さらに進めると、40 回のテストではその確率は 87% となり、100 回では 99.4% に達します。十分な数の比較を行えば、誰でも『発見』を得られることが保証されます。そして、その『発見』の正体は単なる計算上の結果にすぎません。
計算による修正と、それが十分でない理由
修正方法は問題自体と同じくらい単純です。もし m 回のテストを実行し、偽陽性が 1 つでも発生する確率を 5% に抑えたいのであれば、各テストを代わりに α/m の水準で検証します。これがボンフェローニ補正です。20 回のテストを行う場合、p < 0.05 ではなく p < 0.0025 を要求することになります。
t-test tool の α ボックスに 0.0025 を入力し、臨界値に何が起こるかを確認してください。『有意』とされる基準がより厳しくなり、以前の基準を余裕でクリアしていた結果がクリアできなくなります。これが代償であり、無視できない実害です。より厳格な閾値を設けることは、本物の効果を見落とすことを意味します。2 種類の誤りのトレードオフを緩和するより緩やかな補正方法も存在しますが、いずれの方法も統計的検定力を犠牲にします。ここでは何も支払わずに何かを得ることはできないからです。
より深刻な問題は、この補正には m が必要であり、その m は通常知ることができないという点です。それは論文に記載されているテストの数ではなく、実際に実行されたテストの数なのです。論文にまとめられなかったすべてのサブグループ解析、試されたものの取りやめられたすべての評価指標、外れ値の除外に関するすべての選択が、それぞれ 1 つの比較にあたります。1 回のテスト結果のみを報告している研究であっても、実際には 50 回の決定が行われている可能性があり、読者がそれをカウントする方法はありません。
これこそが、イオアニディスが 2005 年に『なぜ発表された研究結果のほとんどは偽りなのか』という意図的に率直なタイトルで指摘した内容です。彼の主張は、研究者が不正を行っているということではありません。多くのグループが多数の仮説(その大部分は最初から偽であるもの)を検証するとき、表面化する有意な発見の大部分は偽りの結果によって占められることになり、しかもその中に含まれる個々のテストは何一つ不正を行っていない、という点にあります。
代わりに何に注目すべきか
この問題を乗り越えるための 3 つの習慣があり、そのすべてをこのサイトのツールで確認することができます。
判定ではなく、効果の大きさに着目する。p 値は「これがノイズであり得るか?」という質問に答えるだけで、それ以外のことは何も示しません。効果がどれほど大きいか、あるいはそれが重要かどうかについては何も語りません。confidence interval tool が存在する理由は、区間という情報が「効果がおよそどこに位置するか」と「それをどの程度正確に把握できているか」の両方を表すからです。区間が「わずかなもの」から「極めて大きなもの」まで広がる有意な結果は、何も教えていないに等しく、p 値はその実態を隠してしまうのです。
違いがどこに存在するのかを問う。有意な結果を示したカイ二乗検定は、表全体が適合していないことを示しているだけであり、どの部分に問題があるのかは分かりません。residuals tool は構造的に同じポイントを示しています。全体の統計量は単なる要約であり、実際の情報は個々のセルに存在します。場所を特定できない発見は、通常、再現できない発見です。
データを見る前に比較の数を数える。データを見る前に何についていくつテストを行うかをあらかじめ決めておくことだけが、機能する唯一の方法です。データが得られた後では、あらゆる閾値が調整可能になり、その調整は不可視だからです。事前登録こそが、m を既知の数にする唯一の方法です。
ページの冒頭でツールが出力した 0.0002982 という値は、確かに十分に小さな p 値です。しかし、それは 1 回のテストから得られた 1 つの数値にすぎず、その意味は数値自体からは分からない事柄、すなわち『それを得るために他に何回のテストを行ったか』に完全に依存しているのです。