本記事は自動翻訳であり、原文は英語です。 原文を読む
回帰直線は2本あり、R²はその2本の間の開きである
どの変数を入力と呼ぶかを入れ替えると、最適合直線が動く。R²はまさにその離れ具合を表している。
最小二乗法は二乗誤差を最小化する直線を求める。だがこの表現には、ある選択が隠されている。誤差をどの方向に測定するのか?
xに対してyをあてはめると垂直方向の距離が最小化される。yに対してxをあてはめると水平方向の距離が最小化される。これらは異なる答えをもつ別の問題であり、しかも両方とも回帰直線と呼ばれる。
2つの傾き
相関係数を r、標準偏差を s と書く。xに対するyの回帰直線の傾きは r·sy/sx である。同じ軸上に描いたyに対するxの回帰直線の傾きは sy/(r·sx) となる。
一方を他方で割ると、r² を除いてすべてが相殺される。
これは偶然でも近似でもない。2つの傾きの比こそが R² であり、あらゆる統計パッケージが出力し、多くの読者が1満点の漠然としたスコアのように扱っている数値そのものである。
なぜ誰も気づかないのか
Linear Regression を開くと、デフォルトのデータ点においてピアソンの r = 0.998、R² = 0.996 と報告される。前者を2乗すると、正確に後者と一致する。
これはまた、そのデフォルトデータにおける2本の直線の違いが 0.4% に過ぎないことも意味する。仮に両方を描いたとしてもその違いを視認することはできず、これこそがあいまいさが見過ごされる理由である。デモ用データは、ほぼ常に強い相関を持っているからだ。
相関を弱めると、2本の直線は急速に離れていく:
- r = 0.9 → 傾きが 19% 異なる
- r = 0.5 → 一方の傾きがもう一方の 4 倍になる
- r = 0 → 一方の直線は水平、他方は垂直になる
相関がゼロのとき、2つの答えは直交する。それでも両者とも正解である。それぞれが自身の対象に対する最良の予測変数だからだ。
r = 0.5 の例を数値で見る
ばらつきが等しく相関が 0.5 である2つの変数を考える。xからyを予測すると傾きは 0.5 になる。つまり、平均より1標準偏差右にある点は、平均より0.5標準偏差上の値を予測する。
次に、yからxを予測する。その傾きも自身の枠組みでは 0.5 だが、元の軸上に描くと 1/0.5 = 2 になる。
一方の直線は 0.5 で立ち上がり、他方は 2 で同じ点群を通り、0.5 / 2 = 0.25 となって、これが r² である。どちらかが他方よりあてはまりが悪いわけではない。これらは異なる問いに答えているのであり、データだけではどちらの意図だったかを教えてはくれない。
これこそが「平均への回帰」である
標準偏差で記述すると、xに対するyの回帰直線は単に zy = r · zx となる。r は最大でも 1 なので、予測値は常に入力値よりも平均に近くなる。
背が高い父親の息子はやはり背が高いが、父親よりも平均に近い。素晴らしい業績の年を過ごした企業は、翌年には「単に良い」程度の業績に落ち着く傾向がある。どちらも特別な原因を必要としない。そして落とし穴は、この効果が対称的であることだ。それらの息子から見ても、父親は自分たちより平均に近いのである。一方向だけでこの現象を説明しようとする物語は、逆方向によって否定される。
ゴルトンはこれを「凡庸への回帰(regression towards mediocrity)」と呼び、この概念に由来して「回帰」という用語が手法全般に定着した。
どちらの直線も求めているものではないとき
どちらの直線も、一方の変数が誤差なく測定されていると仮定している。2つの測定器具を比較するときのように両方にノイズが含まれている場合、どちらの直線も偏り(バイアス)を伴い、真の答えはその間に位置する。
Least-Squares Geometry は根本にある構造を具体化する。あてはめとは射影であり、どの直線が得られるかは射影する方向に依存する。そのデフォルトのあてはめでは SSE が 1.3714 と報告され、その 37.2% をたった1つの点が占めている。これこそ最小二乗法が密かにおこなうもう1つの挙動である。誤差を2乗することは、離れた1つの点が近くの多数の点を圧倒しうることを意味する。
したがって、傾きを報告する前に、それが何目的であるかを判断すべきである。xからyを予測することは1つの問いであり、ノイズを含む2つの量の物理的関係を推定することは別の問いであって、明確な一義的直線が存在するのは前者だけである。