應用:貝氏推論、資訊與模擬

貝氏推論(Bayesian inference)

想像你是一名偵探,先有一個直覺,然後不斷找到線索。貝氏推論就是這件事的有紀律版本:你從對某個未知量已有的信念出發,看到資料,再更新你的信念。整門學問把未知——一枚硬幣的偏差、一種藥的真實療效、明天的需求——不看成一個要被獵捕出來的固定數字,而看成一個用機率分布來描述的量,並隨著證據到來而變得愈來愈尖銳。

在運作上它就是一條有三位主角的方程式。先驗(prior)記作 p(theta),編碼你在看到資料之前對未知 theta 的信念。概似(likelihood)p(data given theta) 說的是對每個 theta 的候選值,觀測到的資料有多合理。貝氏定理把兩者相乘並重新縮放成一個合法的分布:後驗正比於概似乘以先驗,也就是 p(theta given data) = p(data given theta) 乘以 p(theta) 除以 p(data)。分母 p(data) = 對 theta 積分 p(data given theta) 乘以 p(theta) d theta,只是讓後驗積分為 1 的正規化常數。後驗就是你更新後的信念——一整個分布,而非單一猜測——你可以從中讀出它的平均、它的眾數,或一個涵蓋它 95 百分比質量的區間。

威力與爭議都住在先驗裡。因為你必須陳述起始信念,兩位都誠實但先驗不同的人,可能從同一筆資料得到不同的後驗——貝氏學派回答道:當資料累積,概似會淹沒任何合理的先驗,後驗終將收斂。回報是輸出可直接詮釋:一個 90 百分比的可信區間,真的就是一個你相信以 0.9 機率含有 theta 的區間,而這正是多數人誤以為的頻率派信賴區間的意思。代價是真實的後驗通常無法手算,這正是為什麼模擬與馬可夫鏈蒙地卡羅存在。

你懷疑一枚硬幣是公正的卻不確定,於是你對它出現正面的機率 p 的先驗溫和地以 0.5 為中心。你擲了 10 次得到 8 次正面。概似強力地把估計推向較大的 p,先驗溫和地把它拉回 0.5,後驗落在兩者之間——也許以 0.7 附近為中心,但仍然很寬,因為 10 次太少。擲 1000 次得到 800 次正面,後驗就會急遽地緊縮在 0.8 附近:資料已淹沒了先驗。

後驗正比於概似乘以先驗;資料愈多,概似就愈主導。

後驗是一整個分布,而非單一數字;把它塌縮成它的平均,正好丟掉了貝氏推論本來要承載的那份不確定性。

又稱
Bayesian statistics貝氏統計貝氏方法