數學基礎

期望與變異數(expectation and variance)

/ ek-spek-TAY-shun and VAIR-ee-uns /

期望與變異數,是把一個不確定的量「拎出要點」的兩個概括數字:大致該指望什麼,又該為意外做多大準備。期望,也叫期望值或均值,是長程的平均——如果你把這個隨機過程重複上億次再取平均,最終會落定的那個值。它是把每一種可能結果,按其發生的可能性加權所得。

變異數衡量的是「散」:各種結果通常離那個平均值游蕩出多遠。變異數小,意味著結果緊緊偎在均值附近(可預測);變異數大,意味著它們把自己甩得到處都是(動盪不定)。由於變異數是用「距離的平方」搭起來的,單位很彆扭,人們便常對它開平方,得到標準差——它和資料處在同一種單位裡,也更容易在腦中描畫。

這兩個概念在機器學習裡無處不在。模型的「期望誤差」,指引著我們在訓練時要去最小化的目標。偏差—變異數權衡——理解模型為何過擬合或欠擬合的一塊基石——名字就直接取自變異數。而隨機梯度下降的核心把戲——用一小批隨機樣本去估計斜率——之所以行得通,恰恰是因為這個估計有著正確的期望,哪怕任何單獨一批都帶著雜訊。一句值得記牢的實話:期望值可以是一個永遠不會真正出現的數——擲骰子的期望是 3.5,而這一面根本不存在——所以平均是一種有用的「虛構」,並不是對任何單次結果的預言。

一顆公平的骰子,期望是 (1+2+3+4+5+6)/6 = 3.5——而這個值它實際上永遠擲不出來。它的結果攤得相當開,變異數約為 2.9,標準差約為 1.7,意思是一次典型的投擲,落點大致離平均值 3.5 有 1.7 之遙。

期望告訴你中心(3.5);變異數和標準差告訴你各次投擲圍著它散得有多開。

期望值是多次重複下的平均,而非對任何單次試驗的預報——它甚至可能是這個變量永遠取不到的值。變異數用的是平方單位;對它開平方(得到標準差),才能合情合理地拿它和資料本身相比較。

又稱
期望期望值均值方差變異數expected valuemeanvariance标准差standard deviation