本稿は機械翻訳であり、原文は英語です。 原文を読む
精度99%の検査は、大抵間違っている
10,000人の人々、症例の99%を捉える検査、そしてそのうち495人が本来受ける筋合いのない恐ろしい知らせを受け取る。
ある検査が特定疾患を検出する。その検査は罹患している人の99%を捉え、罹患していない人に対してはわずか5%の人にのみ偽陽性を返す。100人に1人がその疾患を抱えている。あなたが検査を受けたところ、陽性と判定された。
あなたが実際にその疾患を抱えている確率はどれくらいだろうか。
直感的な答えは約95%である。正しい答えは16.7%である。陽性と判定された人の大半はその疾患にかかっておらず、これは検査の欠陥ではない。検査は説明書に書かれている通りの挙動を正確に行っているだけである。
4つの掛け算
10,000人の場合を考えてみよう。
- 100人がその疾患を抱えている。検査はそのうち99人を捉える。
- 9,900人は抱えていない。検査はそのうち5%を誤って陽性と判定する。すなわち495人である。
したがって594人が陽性と判定され、そのうち実際に罹患しているのは99人である。99 ÷ 594 = 16.7%。
偽陽性の数は真陽性の数を6対1の割合で上回っており、それには検査の品質とは全く関係のない理由がある。誤判定の対象となる健康な人が単に圧倒的に多いからである。9,900人に適用された5%の誤診率は、100人に適用された99%の成功率が生み出す正解数よりも多くの間違いを生み出すのである。
その疾患がより稀になると、事態は急速に悪化する。有病率が1,000人に1人の場合、同じ検査の陽性的中率は1.9%にとどまる。陽性と判定された50件中49件が偽陽性となる。
なぜ直感が通用しないのか
人々が答えている問いは、尋ねられた問いとは異なる。「検査の精度はどのくらいか」というのは、P(陽性 | 罹患) — すなわち罹患しているという条件のもとで陽性結果が得られる確率についての記述である。あなたが本当に知りたいのは、P(罹患 | 陽性) — すなわち陽性結果が得られたという条件のもとで罹患している確率である。これらは異なる数値であり、両者を入れ替える誤りは非常に一般的であるため名前がついている。すなわち基準率の誤謬、法廷で発生した場合は検察官の誤謬と呼ばれる。
この二つを繋ぐ架け橋となるのがベイズの定理であり、直感が落としがちな項が有病率 — すなわち基準率である。これは検査の宣伝資料が最初に掲げることが決してない数値である。なぜなら、それは検査自体の属性では全くなく、検査を適用する対象集団の属性だからだ。
同じ検査であっても、ある状況では極めて優れ、別の状況では無用となる。すでに症状が出ている患者(有病率が30%に上る可能性がある)に適用した場合、この検査の陽性的中率は89%となる。一方、有病率が0.1%の集団への集団スクリーニングとして適用した場合、その値は1.9%にしかならない。検査機器そのものは何も変化していない。
これが決定的な意味を持つ場面
医療スクリーニング政策。スクリーニング事業がすべての人に提供されるのではなく、年齢やリスクグループによって対象が絞られるのはまさにこれが理由であり、「全員を一律に検査すべきだ」という提案が文字通り受け取る以上に複雑である理由もここにある。有病率のより低いグループへとスクリーニング対象を広げることは、単に費用が増加するだけでなく、陽性結果が意味する価値そのものを変えてしまい、本来病気ではない人々に対して不安や追跡検査、時には実用上の害を生み出すことになる。
セキュリティアラート。偽陽性率1%の侵入検知システムが、攻撃がごくわずかしか含まれない1日100万件のイベントを監視すると、10,000件のアラートが吐き出され、運用チームは通知を読むのをやめてしまう。アラート疲労とは、基準率の誤謬が組織的破綻として顕現した姿である。
法廷。「このDNAの一致が偶然生じる確率は100万分の1である」という言葉は、被告人が無実である確率が100万分の1であることを意味しない。もしその一致が100万件のプロファイルデータベースを絞り込んだ結果得られたものであるなら、偶然だけでもおよそ1件の一致が予想される。この二つの主張は全く同じように聞こえるが、決定的に異なっている。
宇宙生物学。他惑星の生命に関する主張も全く同じ構造に支配されている。バイオシグネチャーの検出という証拠の強さは、そこに生命が存在するという事前確率に依存するが、それこそが誰も把握していない量なのである。Biosignature Bayesツールは、その依存関係を覆い隠すのではなく明示的なものにしている。
身につけるべき唯一の習慣
検査、検知器、あるいはモデルが「精度99%」であると告げられたら、二つの質問をしてほしい。
第一に、どの方向において精度が高いのか。感度と特異度は異なる数値であり、単一の「精度」という数字は通常、そのどちらかを隠している。
第二に、そしてより重要な問いとして、検出対象はどのくらい一般的なのか。もし答えが「稀である」ならば、検知器が指摘するものの大部分は誤りであり、それがどれほど間違っているかは裏紙の簡単な計算で30秒もあれば弾き出すことができる。
Bayes toolは、同じ演算をスライダーで行うことができる。これは主に、有病率を動かしたときに結果がいかに激しく動くか、そして精度を動かしたときにはいかにわずかしか動かないかを確かめるのに有用である。
専門家も間違える
1978年、キャスセルズ、シェーンバーガー、グレイボーイズは、ハーバード大学医学部のスタッフや学生にこの問題のバリエーションを出題した。1,000人に1人が罹患する病気、偽陽性率5%の検査、陽性反応を示した患者。患者が実際にその病気にかかっている確率はいくつか、という問いである。
最も多かった回答は95%であった。正しい答えは約2%である。正解に近い値を出せたのは対象者の5人に1人未満であり、しかも彼らは職業として日頃からそうした検査を処方している人々であった。
この結果は何度も再現されており、医師への糾弾というよりは、人間の心が条件付き確率をどのように処理するかについての描写である。人間の直感は、箱に印刷されている検査機器の精度には容易に飛びつくが、箱には書かれていない有病率を考慮に入れることは決してない。