塔性(平滑性)性質(tower / smoothing property)
想像你分兩階段估計某件事:先得到資料的一個粗略摘要,稍後再得到更細、更詳盡的視角。塔性說的是:如果你把詳盡的估計再平均回粗的層級,你會恰好得到當初直接做出的粗略估計。先細化再粗化,會把你帶回單憑粗視角就會到的地方。你後來丟掉的資訊,對粗略平均根本無關緊要。
形式上,當一個 σ-代數 H 落在較大的 G 之內(H 是較粗的資訊、G 是較細的),E[ E[X given G] given H ] = E[X given H]。較小(較粗)的 σ-代數獲勝:外層、較粗的取條件吞掉了內層、較細的。兩個極端推論是你天天會用的。取 H 為平凡 σ-代數:E[ E[X given G] ] = E[X]——把條件期望再平均便還原成純粹的均值,這正是全期望公式。對單一變數取條件時,這讀作 E[X] = E[ E[X given Y] ],是幾乎每一個巧妙的期望計算的主力:對某個方便的東西取條件,內層先平均,再把它平均掉。
幾何上的理由一行就夠:在 L^2 圖裡,先投影到大子空間、再投影到小子空間,與直接投影到小子空間是一樣的——第一次投影白費了,因為第二次把它所加的細節又丟掉。這就是為什麼此性質又叫「平滑」。方向很重要:唯有當外層取條件是較粗的那一個(H 在 G 之內)時,恆等式才會塌縮。把次序顛倒,E[ E[X given H] given G ] 只是又等於 E[X given H](因為 E[X given H] 已經是 G-可測的),那是不同且較弱的陳述。
一隻母雞下 N 顆蛋,其中 E[N] = 8,每顆蛋各自獨立地以 0.5 的機率孵化。要找小雞數 C 的期望,對 N 取條件:E[C given N] = 0.5 N,於是 E[C] = E[ E[C given N] ] = E[0.5 N] = 0.5 乘以 8 = 4。塔性把一個兩層隨機性的問題化成了一行計算。
先細化再粗化會回到粗略估計;較小的 σ-代數獲勝。
塌縮需要外層取條件是較粗的那一個(H 在 G 之內)。「E[E[X given G] given H] = E[X given H]」——記住存活下來的是較小的 σ-代數,不是較大的。