條件機率、獨立性與貝氏定理

似然(likelihood)

似然衡量一個假設對你實際觀察到的證據解釋得有多好。在貝氏定理中它是 P(B given A) 那一項:若假設 A 為真,觀察到的證據 B 有多大機率出現?一項在疾病存在時幾乎總是讀為陽性的檢測,對陽性結果有很高的似然;很少這樣的檢測則似然很低。似然是資料發聲的管道。

這裡有個細微卻重要的語言之分。P(B given A) 可從兩個方向讀。把它看成 B(資料)的函數而固定假設 A,它是一個普通的條件機率,對所有可能資料加總為 1。但把它看成 A(假設)的函數而把資料 B 固定在你所見的值,它就叫似然——而作為假設的函數,它不必加總為 1;它不是假設上的機率分布。我們跨假設比較似然,看哪一個能讓觀察到的資料最不令人意外。

似然是證據的引擎。貝氏定理說後驗正比於先驗乘以似然,所以似然正是依照所發生的事情、對你的先驗信念重新加權的那個因子。兩個競爭假設下似然的比值——似然比——是總結證據偏好某假設甚於另一假設強度的最乾淨的單一數字,它驅動貝氏的勝率形式。

你在 10 次投擲中看到 8 次正面。在「公正硬幣」之下這筆確切資料的似然是 C(10,8)(0.5)^10 = 約 0.044。在「偏差,p = 0.8」之下是 C(10,8)(0.8)^8(0.2)^2 = 約 0.302。偏差假設使資料的可能性高得多——其似然約為 7 倍。

似然問的是:每個假設對我們實際得到的資料預測得有多好?

高似然本身並不使一個假設變得有可能——你仍須乘以它的先驗。一個離奇的假設可能完美契合資料,卻因先驗極小而仍然不可能。

又稱
likelihood functionP(evidence given hypothesis)概似似然度