貝氏定理(Bayes' theorem)
/ BAYZ /
貝氏定理是把一個條件機率反轉過來的規則。你常常知道 P(證據 given 假設)——例如,當某人確實患病時檢測讀為陽性的頻率有多高——但你真正想要的是 P(假設 given 證據):既然檢測為陽性,患病的可能性有多大?這兩者並不相同,而貝氏定理精確告訴你如何把一個換成另一個。
公式是 P(A given B) = P(B given A) P(A) / P(B)。它由條件機率定義的兩種寫法一行推出:P(A and B) 同時等於 P(B given A) P(A) 與 P(A given B) P(B),令兩者相等再相除即得。分母 P(B) 通常用全機率公式對各假設展開:P(B) = P(B given A) P(A) + P(B given not A) P(not A)。把各部分讀成信念更新:P(A) 是先驗(看到證據前的信念),P(B given A) 是似然(證據與假設契合的程度),而 P(A given B) 是後驗(更新後的信念)。貝氏定理說:後驗正比於先驗乘以似然。
這大概是機率中最有用的單一概念:垃圾郵件過濾器如何權衡字詞、醫師如何解讀檢測、搜尋演算法如何定位失蹤潛艇,乃至整個統計學派的基礎,都靠它。最重要的誠實提醒是:答案高度取決於先驗 P(A)。對一種極罕見疾病而言,一個非常準確的檢測仍可能使後驗低得出人意料,因為大多數陽性來自龐大的健康多數——忽視這點就是基本比率謬誤。
某疾病盛行率為千分之一。一項檢測雙向皆 99% 準確(抓出 99% 的患者,誤標 1% 的健康者)。你檢測為陽性。P(患病 given 陽性) = (0.99)(0.001) / [(0.99)(0.001) + (0.01)(0.999)] = 0.00099 / 0.01098,約 9%。儘管檢測有 99%,你最可能仍是健康的。
罕見疾病加上在眾多健康者之中的微小偽陽性率,淹沒了真正的陽性。
貝氏定理本身是無爭議的算術;爭論在於先驗從何而來。錯誤或任意的先驗會給出錯誤的後驗——輸入垃圾,輸出垃圾。