最佳均方預測(best mean-square predictor)
假設你必須從資訊 Y 預測 X,而你的成績由誤差大小的平方平均來評分——大失誤遠比小失誤痛得多。在所有可想像的預測規則中,哪一個能把那個期望平方誤差最小化?乾淨而完整的答案是:用條件期望來預測。E[X given Y] 是基於 Y 對 X 的唯一最佳均方預測,就這樣。
精確地說,在所有函數 g 之中,選 g(Y) = E[X given Y] 能把 E[ (X - g(Y))^2 ] 最小化。理由是 L^2 投影的幾何:E[X given Y] 是 X 在 Y 的函數空間上的正交投影,因而是均方距離下最近的那種函數。任何其他猜測 h(Y) 都付出嚴格更大的誤差,而由畢氏定理你能精確看出多多少:E[ (X - h(Y))^2 ] = E[ (X - E[X given Y])^2 ] + E[ (E[X given Y] - h(Y))^2 ]。第一項是你永遠無法擊敗的不可約誤差(由全變異數公式,其大小是 E[ Var(X given Y) ]);第二項是選錯規則所付的可避免代價,唯有當 h 等於條件期望時它才消失。
正是這個單一事實,使條件期望成為貫穿統計、訊號處理、濾波與機器學習的那個「最佳估計」概念——一個迴歸模型字面上就是企圖逼近 E[X given Y]。兩個誠實的提醒。第一,這裡的「最佳」是在平方誤差損失下;換一種損失,最佳就變了——絕對誤差損失下的最佳預測是條件中位數,而非條件均值。第二,著名的線性最小平方預測(迴歸直線)只是「線性規則之中」的最佳;真正的最佳預測 E[X given Y] 可以是彎曲的,兩者只在特殊情形(如二元常態)才一致。
如果你必須在已知今天 Y 的情況下預測明天的氣溫 X,而你以均方誤差計分,沒有任何規則能勝過 g(Y) = E[X given Y]。一個平坦的猜測(忽略 Y)會更差;甚至穿過散點的最佳直線也會更差,除非真實關係恰好是線性的。殘餘誤差 E[Var(X given Y)] 是天氣本身的真正不可預測性,沒有任何估計子能消除它。
在平方誤差損失下,E[X given Y] 是無可匹敵的預測。
「最佳」僅在平方誤差損失下——絕對誤差下最佳的是條件中位數。而迴歸直線只是線性預測中的最佳;真正的最優 E[X given Y] 可以是非線性的。