因果関係サンドボックス

異なる因果構造から合成データを生成し、相関と傾きがどう変化するかを観察する。

インタラクティブシミュレーションを読み込んでいます...

因果グラフが相関表に勝る理由 🖖

<p>相関は2つの変数が一緒に動くことを示すだけで、なぜ動くかは示さない。同じ数値でも、根本的に異なる3つの構造から生じうる。</p><ul><li>直接の原因(X → Y): X を取り除くと Y が変化する。</li><li>交絡因子(Z → X、Z → Y): Z が両方の原因であり、X と Y は相関しているが、どちらも相手の原因ではない。Z を制御すると相関は消える。</li><li>合流点(X → Z ← Y): X と Y は独立しているが、Z で選抜または条件付けを行うと、両者の間に見せかけの関係が生まれる。</li></ul><p>グラフ中の有向非巡回グラフ(DAG)は、どの変数が原因でどれが結果かを示している。これがなければ、単一の相関係数だけからこれらのケースを区別することはできない——だからこそ因果推論は常に相関行列ではなく構造モデルから始まる。</p>

相関は見ること、因果は介入すること 🖖

このサンドボックスの核心は、変数を「見る」ことと「変える」ことの違いにある。交絡因子も合流点も、隠れた過程がすでに形づくったデータしか観測できないために私たちを欺く。ランダム化実験はこれを断ち切る。コイン投げでXを割り当てれば、Xに入るすべての矢印が切断され、残ったYとの相関は必ず因果的になる。だからこそ、対照実験は観測データをいくら積み上げても答えられない問いに決着をつけられる。

バークレー入学審査のパラドックス 🖖

シンプソンのシナリオは机上の遊びではない。1973年、カリフォルニア大学バークレー校の大学院入学では男性の約44%が合格したのに対し女性は35%で、差別を疑わせた。ところが学部ごとに見ると女性の合格率はむしろわずかに高く、単に女性が最も競争の激しい学部に大挙して出願していただけだった。学部を通じて合算すると集団内の傾向が逆転する——このツールの破線がなぞるのは、まさにその逆転である。

例題

  • 因果 - X→Yの直接的な因果関係により、正当な理由で強い相関が生じる
  • 交絡 - 隠れた変数ZがXとYの両方を引き起こし、直接の因果関係がなくても相関が生じる
  • 合流点 - 合流点(コライダー)で条件付けを行うと、見せかけのX-Y関連が生じる
  • シンプソン - データを部分集団ごとに分けると、全体の傾向が逆転する