これは機械翻訳であり、原文は英語です。 原文を読む
データ内のすべてのグループが下降傾向を示し、全体としては上昇傾向を示す。
誰も過ちを犯しておらず、何一つ欠落しておらず、サンプルが小さすぎるわけでもない。同一のデータに対する2つの正しい計算が、正反対の方向を指し示している。
Causality Sandboxを開き、そのSimpsonプリセットを押す。パネルにはXとYの相関が0.1702、適合傾きが0.0928と表示されている。正の値であり、Xが増加するとYも増加する。
その直下で、同じパネルは第3の列Gで分割した後の同じ点群に再び適合を行っている。G = 0における傾き:−0.5842。G = 1における傾き:−0.6109。
すべてのグループが下降している。全体は上昇している。これら2つの計算の間で、行の追加、削除、重み付け、変換は一切行われていない。行われたのはグループ化だけである。
どのようにして両方が成り立ち得るのか
その仕組みは一度理解してしまえば完全に機械的なものであり、サンプルサイズや統計的有意性とはまったく関係がない。
第3の列は一度に2つの役割を果たしている。パネルにはXとその変数との相関が0.8061、Yとその変数との相関が0.6884と表示されている。したがって、散布図においてグループどうしが重なって配置されているわけではない。一方は低X・低Y領域を占め、他方は高X・高Y領域を占めている。各グループは内部的には右下がりのクラウドであり、これら2つのクラウドが右上がりの対角線に沿って積み重なっている。
両方のクラウドを通して1本の直線を引くと、その直線は2つのクラウド間のオフセットに支配される。なぜなら、そのオフセットはどちらのクラウドの幅よりもはるかに広い範囲にわたっているからである。プールされた直線はグループ間のギャップを測定している。グループ内の直線はグループ内部の関係を測定している。両者が一致しないのは異なるものを測定しているからであり、どちらの場合も算術としては完璧である。
このことは、データを増やしてもこの現象が解消されない理由も説明している。10倍のデータ点を集めても、両方の推定値はそれぞれの既存の正反対の値の周りに収束していくだけである。シンプソンのパラドックスは標本抽出ノイズではない。小標本によるアーティファクトでもなければ、回帰の失敗でもない。重要な変数で集計を行ったときに生じる現象なのである。
この現象を有名にした事例
1973年秋のバークレー校の大学院入試である。男性志願者の約44%が合格したのに対し、女性は35%であり、12,000件以上の出願全体で9ポイントの開きがあった。偶然とするにはあまりにも大きな差であった。
その後、ビッケル、ハンメル、オコーネルは学科ごとに分割して分析を行った。ほとんどの学科では女性にやや有利な偏りがみられ、プールされた全体の差は消滅した。集計上の差は、人々がどの学科に志願したかによってほぼ完全に生じていたのである。女性は誰にとっても合格率が低い学科に多く出願し、男性は志願者のほぼ半数を合格させる学科に出願していた。学科は、プリセットにおいてGが果たす役割(入力および結果の両方と相関する役割)とまったく同じ役割を果たしていたのである。
バークレー校の研究を読む価値があるのは、その結論の慎重さゆえである。著者らは偏りが存在しなかったと発表したわけではない。彼らは偏りが移動したのだと指摘した。志願者を過密で競争率の高い分野に向かわせていた要因が何であれ、それは選考委員会の手前に存在しており、彼らのデータでは捉えられなかったのである。層別化によって判明したのは、どこを見るべきでないかということであり、これはささやかながらも本物の成果であった。
どちらの数値を使用すべきか?
この現象が単なる好奇心の対象にとどまらない理由がここにある。「常に層別化すべきである」という一見明白な教訓が誤りだからである。
治療の割り振りが患者の重症度と相関していたある薬物治験を考えてみよう。より重症な患者により頻繁に新薬が投与されたとする。データをプールすると、薬は有害であるように見える。重症度ごとに分割すると、すべての層において効果を示している。この場合は分割した結果をとるべきである。なぜなら、重症度が誰に薬を投与するかと治療結果の両方に影響を与えたからである。重症度は交絡因子であり、それを調整することで歪みが取り除かれる。
次に、薬が血圧を下げることで作用する治験を想定し、治療後に測定された血圧でデータを分割してみる。各層内では、薬は何の効果も及ぼしていないように見える。薬自身の作用メカニズムによってグループ化を行ってしまったからである。ここでは、プールされた全体の数値が正しいものであり、調整を行うと測定しようとしていた効果を破棄してしまうことになる。サンドボックスには、この構造に対するプリセットも用意されている。それがcollider(合流点)であり、これは両方の入力が向かう変数であって、これで条件付けを行うと、存在しない関係が作り出される。
これら2つのケースは、まったく同一の数値の表を生み出す可能性がある。データ内部の何ものも、両者を区別することはできない。プールされたデータか分割されたデータかの選択は、どの変数が先であったかという「因果構造」に関する主張であり、因果構造は列の中には存在しない。これこそが、このパラドックスが一度解けば終わるパズルではなく、観察研究において不可避的に存在する特徴である理由である。統計は可能性を絞り込むだけであり、統計の外部にある何かが選択を行わなければならないのである。
シンプソン自身も1951年に、その評判よりも慎重な論文の中でこの点を指摘している。彼は分割表において逆転現象を構成し、そのうえで「分別ある解釈」は表そのものではなく、カテゴリーの意味に依存すると論じた。算術には何ら曖昧さはない。曖昧なのは問いのほうである。
どのように対処すべきか
ここから3つの習慣が導かれる。しかもそれらはコストがかからない。
適合を行う前にプロットすること。オフセットのある2つのクラウドを通るプールされた傾きは、散布図では一目で確認できるが、相関係数では見分けることができない。regression toolは適合結果とともに残差を表示し、積み重なったグループはそこに紛れもない特徴を残す。すなわち、散乱しているのではなく、大きく、構造化され、グループ化された残差である。
計算を行う前に、何が何を引き起こしたと考えたのかを書き出すこと。ある変数がなぜモデルに含まれるのかを説明できないのであれば、その変数を調整することが交絡因子を修正しているのか、それともメカニズムを破棄しているのかを判断することもできない。そして事後的にどちらの選択も正当化できてしまうことこそが、まさに危険なのである。
異質なグループ全体にわたって計算された単一の見出しの数値を疑うこと。全国平均、全社的指標、集計傾向のいずれも、逆方向に動いているかもしれないクラウド間に跨がるプールされた傾きにすぎない可能性がある。プリセットにおける逆転現象に必要なのは、わずか2つのグループと1つの相関変数だけであった。現実のデータは、その両方を何十個も提供しているのである。