後驗預測分布(posterior predictive distribution)
一旦貝氏模型消化了資料,你通常真正在乎的問題不是「未知參數是多少?」,而是「下一筆觀測會長什麼樣?」後驗預測分布回答的正是這個:它是一個未來資料點的機率分布,已把資料教給你關於未知的一切——以及關鍵地,把「你對那個未知仍不確定」這件事——都計入。
做法是把概似對後驗取平均。對一個未來觀測 x_new,p(x_new given data) = 對 theta 積分 p(x_new given theta) 乘以 p(theta given data) d theta。把這個積分讀成:對每個合理的 theta 值,用那個 theta 來預測 x_new,再按 theta 在資料之光下的合理程度給每個預測加權,然後混合起來。這比單一的「代入」預測更誠實:若你只是把 theta 固定在它的後驗均值再從那裡預測,你就假裝完全知道 theta。藉由對整個後驗積分,預測分布會自動變寬,以吸收你對 theta 殘餘的不確定——所以它理當比任何單一 theta 的預測有更肥的尾。
這是預測、模型檢驗與決策的主力。你檢驗一個模型的方式,是問真實資料看起來像不像從後驗預測抽出的(若你觀測到的資料在它之下極不可能,那模型就錯了)。你預測需求、故障或銷售時,給的是帶完整不確定帶的結果,而非一個騙人的點估計。誠實的提醒:預測只有跟產生後驗的那個模型與先驗一樣可信——對後驗取平均計入了參數的不確定,卻沒計入「你整個模型族形狀根本就錯了」的可能。
在前面貝它-二項的點擊例子給出 Beta(7, 25) 後驗之後,下一位訪客點擊的機率就是 p 的後驗均值,即 7/32 約 0.22——而接下來 100 位訪客中點擊次數的預測分布,是一個貝它-二項分布,明顯比單純的 Binomial(100, 0.22) 更寬,因為它把你對真實率的不確定折入其中。
把預測對整個後驗取平均,這樣未來的不確定就把參數的不確定也包含進去。
用單一代入的點估計來預測會低估不確定性;後驗預測之所以真的更寬,是因為它對所有合理的參數值積分。