先驗、後驗與似然(prior, posterior, likelihood)
/ PRY-or, pos-TEER-ee-or, and LY-kli-hood /
這三個詞是每一次貝氏更新裡的角色陣容,它們對應著一個簡單的故事。先驗,是你在看今天的資料之前所相信的。似然,是在問:對每一種可能的解釋來說,它把我剛看到的資料解釋得有多好?後驗,則是你看完之後的信念——先驗被證據重新塑形後的樣子。一句話概括:後驗正比於先驗乘以似然。
用天氣作例子就具體了。你的先驗也許是:你所在小鎮任意一天有30%的機率下雨。似然描述的是:在「今天會下雨」與「今天不下雨」兩種情形下,分別有多大可能出現一片烏沉沉的厚重天空——而烏雲密布在快下雨時要常見得多。當你抬頭望見那樣的天空,你「下雨」的後驗機率便遠遠竄過了30%。先驗是你的基準線,天空是證據,後驗則是更新後的預報。
有兩點誠實的提醒,能避免這些詞被誤用。其一,似然不是「某解釋為真」的機率——它是「在給定某解釋下,資料出現」的機率,是反過來讀的。其二,先驗是一個貨真價實的假設,而非中立的起點:資料多時先驗會淡去、似然占上風,但資料少時,先驗會悄悄左右答案。把這三者一一點名,會逼著你說清楚:你假設了什麼、你觀察到了什麼、你現在又相信什麼。
你擲一枚新硬幣,想知道它偏向正面的程度。先驗:你假定它多半是公平的,峰值落在0.5附近。似然:你擲了10次得到7次正面——資料偏向略高於0.5的偏置。後驗:兩者的融合,也許中心落在0.6左右,但因為10次太少,分布仍然很寬。若擲1,000次得700次正面,後驗就會牢牢收緊在0.7附近,先驗幾乎被遺忘殆盡。
資料越多,後驗越窄,也越能蓋過先驗;資料少時,先驗依然聲音洪亮。
一個常見的口誤,是把似然當成「在各種解釋上的機率分布」——它不是。似然是解釋的函數,卻是資料的機率;它在各解釋上加起來不必等於1。只有後驗,才是你真正想知道之事的一個正規機率分布。