充分統計量(sufficient statistic)
當你手上有一大堆資料、卻只在乎一個參數時,能把整份資料壓縮成幾個數字,而不丟失任何對那個參數重要的資訊,那將是再好不過。充分統計量正是這樣一個無損的摘要:一個資料的函數,捕捉了資料對未知參數所能告訴你的一切——一旦你知道它,原始資料就再也沒有東西可補充。
精確的想法由取條件來刻畫。一個統計量 T(data) 對參數 theta 是充分的,若給定 T 時整份資料的條件分布完全不依賴 theta。白話說:一旦你被告知 T 的值,資料裡剩下的隨機就只是與 theta 無關的雜訊,所以除了 T 以外,資料不再帶有關於 theta 的額外線索。實用的檢驗是費雪-奈曼因子分解準則:T 充分,恰好當概似可因子分解為 p(data given theta) = g(T(data), theta) 乘以 h(data),其中參數 theta 只透過 T 觸及資料。對 n 次獨立白努利試驗,成功的總數對成功機率是充分的——正面與反面的具體順序無關緊要。對均值與變異數皆未知的常態資料,樣本和與平方和合起來是充分的。
充分性是資料縮減的正式骨幹。它告訴你,一個最大概似估計或一個貝氏後驗,只能透過充分統計量依賴資料,所以你可以只儲存與傳輸 T 而毫無損失。Rao-Blackwell 定理甚至表明,任何估計量都能藉由對充分統計量取條件而被改進(其變異數被降低)。誠實的提醒:充分性永遠是「相對於」一個特定模型的。成功計數對白努利成功機率充分,但若你暗自懷疑那些試驗並非同分布,被丟掉的順序就突然又重要了——丟掉「無關」的細節,只有在你的模型真的正確時才安全。
擲一枚硬幣 100 次來估計它的偏差。資料是一個長度 100 的 H 與 T 序列,但光是正面的計數就充分了:HHTTH... 與 THHTH... 只要正面總數相同(比如 58),就攜帶關於偏差的相同資訊。你可以丟掉順序、只留「100 中 58」,而不丟失任何與估計 p 相關的東西。
充分統計量把資料擠壓到它有資訊的核心——但只對一個特定模型而言。
充分性永遠是相對於一個假設模型而言的;被丟掉的細節只有在那個模型正確時才真正無關,所以充分統計量可能藏起了正好能揭露模型有誤的那份證據。