條件期望與條件化

給定隨機變數的條件期望(conditional expectation given a random variable)

假設你想猜一個人的體重(記為 X),但我先告訴你他的身高(記為 Y)。你最好的策略不是某個固定數字——它要看我告訴你的身高是多少。對每一個可能的身高值 y,你會說出所有那個身高的人的平均體重。這條「輸入身高、輸出平均體重」的規則,就是給定 Y 時 X 的條件期望。它回答的是:一旦我知道了 Y,我對 X 之平均的更新後最佳估計是多少?

具體來說,對每個值 y,我們算一個 X 的普通平均,但限制在世界中 Y = y 的那一薄片上。離散情形下這個平均是 E[X given Y = y] = 對 x 求和 x 乘以 P(X = x given Y = y);連續情形下則用條件密度:E[X given Y = y] = 積分 x 乘以 f(x given y) dx。這給出一個函數 g,其中 g(y) 就是那一薄片的平均。關鍵的轉折在於我們所謂的 E[X given Y]:我們並不代入固定的 y,而是代入隨機的 Y 本身,於是 E[X given Y] = g(Y) 是一個全新的隨機變數——它隨著結果改變,因為 Y 會變。在你觀測到 Y 之前,你的最佳估計本身就是隨機的。

這正是從初等機率通往現代理論的橋樑。函數 g 恰恰就是統計學家所配適的迴歸曲線,而 E[X given Y] 是用 Y 建立的對 X 的最佳均方預測。最常見的混淆只有一個:E[X given Y = y] 是一個數字(固定 y 的薄片平均),而 E[X given Y] 是一個隨機變數(同一條規則餵入隨機的 Y)。把這兩者分清楚,幾乎所有其他東西就都各就各位了。

擲一顆公正的骰子;令 Y = 1 若結果是偶數、0 若是奇數。則 E[X given Y = 1] 把 {2,4,6} 平均得到 4,E[X given Y = 0] 把 {1,3,5} 平均得到 3。於是 E[X given Y] 是一個隨機變數,在偶數時等於 4、在奇數時等於 3——而它本身的平均 (4 + 3)/2 = 3.5 又還原成 E[X]。

E[X given Y] 是一個隨機變數:對 Y 的每個值都是一個不同的薄片平均。

E[X given Y = y] 是一個數字;E[X given Y] 是一個隨機變數(Y 的函數)。把這兩者混為一談是初學者的典型錯誤。

又稱
E[X given Y]conditional meanregression function條件均值迴歸函數