條件期望與條件化

條件機率作為指示函數的條件期望(conditional probability as the conditional expectation of an indicator)

有一個單一的想法,讓條件期望的整套機制也能處理條件機率,於是你永遠不需要為事件另立一套理論。竅門是指示變數 1_A,當事件 A 發生時它等於 1、不發生時等於 0。它的普通期望恰是 A 的機率:E[1_A] = P(A)。把這同一個指示函數對資訊 G 取條件,就把它變成一個條件機率。

精確地說:P(A given G) 定義為 E[ 1_A given G ]。這是一個隨機變數——你用 G 裡的資訊對 A 發生之機會所做的最佳估計。所有條件期望的性質都免費移轉過來:它非負且至多為 1(把正性套到 0 <= 1_A <= 1 上);塔性變成全機率公式;「把已知拿出來」特化成關於你已知事件的事實。當 G 由變數 Y 生成時,P(A given Y) 就是你在初等條件機率裡遇過的那個 Y 的函數,如今有了堅實的地基。

這個統一不只是整潔——它正是使現代理論一致的原因。但它藏著一個真正的微妙處。對每個固定的事件 A,P(A given G) = E[1_A given G] 只在一個機率為零的集合之外有定義,而事件 A 有不可數那麼多。這些例外的零測集會隨 A 變化而堆積起來,所以並沒有自動的保證讓族 { P(A given G) : A } 對幾乎每個結果同時表現得像一個誠實的機率測度(可數可加)。修補這一點——把版本選得彼此相容——正是正則條件分布的問題。

想要 P(A given Y)?只要算 E[ 1_A given Y ]。對一顆骰子,A = {結果為質數} = {2,3,5}、Y = 奇偶性,E[1_A given Y = 偶] 把 1_A 在 {2,4,6} 上平均,得 (1 + 0 + 0)/3 = 1/3;而 E[1_A given Y = 奇] 在 {1,3,5} 上平均,得 (0 + 1 + 1)/3 = 2/3。這些就是 P(A given 偶) 與 P(A given 奇)。

條件機率就是對著一個指示函數的條件期望。

對每個固定的 A 這很乾淨,但每個 P(A given G) 只在一個零測集之外有定義;當 A 遍歷不可數多的事件時,零測集可能累積,所以這個族不一定能拼成一個貨真價實的測度——正則條件分布處理了這一點。

又稱
P(A given G) = E[1_A given G]probability via indicators以指示函數表條件機率