カイ二乗と残差マップ

セルの度数を変更すると、有意性と残差のホットスポットが即座に更新される様子を確認できる。

インタラクティブシミュレーションを読み込んでいます...

適合度境界とカテゴリ分散 🖖

カイ二乗検定は、観測頻度(O)と期待頻度(E)を比較することで、カテゴリ変数間の関連性を評価します(χ² = Σ (O - E)² / E)。残差は、各カテゴリが帰無仮説の予測からどれだけ逸脱しているかを示します。この検定は、連続近似の妥当性を維持するため、期待度数が極端に小さくないこと(通常5以上)を前提とします。

関連が実際にどこにあるか 🖖

単一のカイ二乗値とそのp値は、2つのカテゴリ変数がそもそも関連しているかどうか、いわばイエスかノーの判定しか教えてくれません。本当の物語は標準化残差のマップにあります。色付きの各セルは、独立を仮定した場合の予測より特定の組み合わせがどれだけ多く、あるいは少なく現れるかを示します。正の残差は過剰に多い組み合わせを、負の残差は過小な組み合わせを表します。実践的な教訓は、生の度数が最大のセルではなく、最も明るいセルを追うことです。

ピアソンが拒んだフィッシャーの修正 🖖

ここに表示される自由度 (r−1)(c−1) は、激しい統計論争から生まれました。カール・ピアソンは1900年にカイ二乗検定を導入しましたが、自由度を単純なカテゴリ数から求めていました。1922年、ロナルド・フィッシャーは、表自身の周辺度数から推定した期待度数がそれぞれ自由度を1つ消費することを示しました。だからこそ r×c の表は rc−1 ではなく (r−1)(c−1) になります。ピアソンは生涯この修正を拒み続けましたが、正しかったのはフィッシャーで、その式をここのすべての表が使っています。

例題

  • 弱い依存関係 - 弱い依存関係:カイ二乗値は中程度で、残差のホットスポットは小さい。
  • 強い関連 - 強い関連性:残差のホットスポットが大きく、カイ二乗値も高い。
  • 疎な警告ケース - 疎な分割表:期待度数に関する警告が検定の限界を示している。
  • バランスの取れた基準例 - バランスの取れた分割表:ほぼ独立しており、残差の大きさも小さい。