條件變異數(conditional variance)
變異數衡量一個變數在其均值周圍的散布程度。條件變異數問同樣的問題,但是在你被告知某些資訊之後:一旦我知道了 Y(或一個 σ-代數 G),關於 X 還「剩下」多少不確定性?它是取條件後殘存的散布——在做出最佳估計之後仍無法預測的殘餘部分。
與普通變異數直接類比,Var(X given G) = E[ (X - E[X given G])^2 given G ],它(正如 Var(X) = E[X^2] - (E[X])^2)可改寫為 E[ X^2 given G ] - ( E[X given G] )^2。和條件期望一樣,它是一個隨機變數:依你落在哪一片資訊上,它可以取不同的值——對某些 Y 的值,知道 Y 可能讓 X 的散布大幅縮小,對另一些則縮小得少。它永遠非負(這就是 phi(x) = x^2 的條件 Jensen),而它恰好為零當且僅當 X 已被 G 決定,因為那時沒有東西可變了。
條件變異數是變異數分解恆等式——全變異數公式——的核心:Var(X) = E[ Var(X given Y) ] + Var( E[X given Y] )。換句話說,X 的總不確定性乾淨地分成兩塊:知道 Y 之後平均殘餘的不確定性(「未解釋的」、組內部分)加上條件均值本身的變動性(「已解釋的」、組間部分)。這是統計學中變異數分析分解、以及機器學習中偏差-變異權衡的機率骨架。要注意:Var(X given Y) 是 Y 的函數(一個隨機變數),不是單一數字——在拿它與普通變異數比較之前,先用 E[ · ] 把它平均掉。
隨機挑一枚硬幣:H 型公正(p = 0.5)、T 型偏倚(p = 0.9),各以 0.5 機率挑中,然後擲一次(正面時 X = 1)。Var(X given 硬幣) 對 H 型是 0.5(0.5) = 0.25、對 T 型是 0.9(0.1) = 0.09。硬幣內的平均是 E[Var(X given 硬幣)] = 0.17,硬幣間的部分 Var(E[X given 硬幣]) = {0.5, 0.9} 的變異數 = 0.04,相加得 Var(X) = 0.21。
總變異數 = 組內平均散布 + 組均值的散布。
Var(X given Y) 是一個隨機變數(Y 的函數),不是一個數字。在全變異數公式裡,你必須先把它平均,E[Var(X given Y)],再加上條件均值的變異數。