貝它二項分配(beta-binomial distribution)
/ BAY-tuh by-NOH-mee-al /
貝它二項分配回答一個你連成功機率都不確定的二項問題。普通二項假設所有 n 次試驗共用一個固定且已知的 p。但 p 本身往往不確定、或在不同群組間變動:不同的網站訪客有不同的點擊傾向、不同病人有不同的治癒機率、一批硬幣中各枚可能偏差不一。貝它二項的處理方式,是把 p 視為在試驗開始前從一個貝它分配抽出的隨機量,而非固定的數。
就機制而言,它是兩步驟的配方、一種混合。先從形狀參數為 a 與 b 的貝它分配抽出 p——貝它分配活在 0 到 1 的區間上,因而是未知機率的天然分配。然後固定那個 p,跑一個有 n 次試驗的二項。對所有可能抽出的 p 值將二項平均,就得到貝它二項 pmf。均值算出來是 E[X] = n 乘以 a/(a + b),其中 a/(a + b) 是貝它自己的均值(p 的期望值)。與二項最關鍵的不同在離散程度:因為 p 本身會晃動,變異數被一個額外因子膨脹到超過 n p (1 - p),所以貝它二項是過度離散的。試驗也變得正相關——一旦自然為這個群組選了高的 p,它的所有試驗就一起偏向成功。
這是負二項為計數處理的同一種過度離散的離散資料版本,也是貝氏統計的主角:p 上的貝它先驗與二項資料結合,正是其預測分布為貝它二項的共軛設定。每當「成功率在各單位間變動」或「同一群集內的試驗相關」比單一全域 p 更貼切描述你的資料時,就取用它。
從每家工廠測試 n = 10 個小零件,但各廠品質不一。把各廠的通過率 p 建模為 Beta(2, 2)(中心在 0.5 但會變動),各廠通過數為貝它二項,均值 10 乘以 2/4 = 5,但離散程度比普通的 Binomial(10, 0.5) 更寬。
讓 p 自己是隨機的(貝它),再跑一個二項——結果是過度離散的。
當成功機率在各單位間變動、或群集內試驗相關時,使用貝它二項。對這類資料硬套普通二項會低估變異數。