先驗、概似與後驗(prior, likelihood, and posterior)
這三者是每一次貝氏更新的演員,要分清楚它們,最乾淨的辦法是看每一個是「關於誰的函數」以及「代表什麼」。先驗是你在資料之前對未知的信念;概似是資料對未知每個可能值的裁決;後驗是資料說話之後你對未知的信念。貝氏推論不過就是把前兩者變成第三者的規則。
對每一個都要精確。先驗 p(theta) 是一個如假包換、定義在未知 theta 上的機率分布——它積分為 1,你可以從中抽樣。概似 L(theta) = p(data given theta) 在公式上跟資料的機率是同一個,但現在你把資料固定、讓 theta 變動;這個翻轉就是重點所在,也正因如此,概似是 theta 的函數,而不是 theta 上的機率分布(它不必積分為 1)。後驗 p(theta given data) 又是一個真正定義在 theta 上的分布,由「後驗正比於概似乘以先驗」再正規化而得。一個有用的心像:先驗是 theta 上一座柔和的小丘,概似是資料刻出的第二座小丘,把它們逐點相乘就產生後驗那座小丘,它坐落在兩者都同意之處,並比兩者都更窄。
有兩個混淆值得先打預防針。第一,概似不是「theta 為真的機率」——在頻率派讀法裡 theta 是固定的,概似是「給定那個 theta 時資料的機率」,再當成 theta 的函數來讀。第二,資料少時後驗倚靠先驗,資料多時後驗倚靠概似;沒有哪一方永遠主導,而看著這個平衡隨資料增長而移動,正是你檢驗一個貝氏模型是否合理的方法。
估計一名籃球員真實的罰球命中率 p:以 0.75(聯盟平均)為中心的先驗說「大概是個好射手」。她接著 10 罰中 9。概似(正比於 p^9 乘以 (1-p)^1)的峰值在 0.9。後驗——乘積重新正規化後——落在兩者之間,約 0.82——同時反映了先驗的智慧與新鮮但量少的樣本。
把先驗乘以概似、正規化,就得到後驗——更新後的信念。
概似是 theta 的函數,不是 theta 上的機率分布——它一般不積分為 1,把它讀成「theta 為真的機率」是常見錯誤。