期望值、變異數與動差
重尾與均值何時誤導
均值太熟悉了,我們本能地就伸手去取,但有整整一類情況裡它是個糟糕、甚至毫無意義的摘要。罪魁通常是重尾:在這些分布裡,極端值雖然個別罕見,卻夠常見又夠大,足以主導全局。在這種世界裡,「平均」告訴你的是一個幾乎從不發生的典型結果。
想像一個小鎮,每個人年收入約 4 萬,然後一位億萬富翁搬了進來。均值所得躍升到數百萬,而中位數(站在中間的人)幾乎沒動,仍然描述著幾乎所有人。這就是右偏、重尾資料的特徵:少數巨大的值把均值從分布主體拉得老遠。對強烈重尾的律,均值是不穩定的——隨著你蒐集更多資料,樣本平均不斷跳動而非安定下來——而在柯西分配這個極端情形,均值根本不存在:定義 E[X] 的積分發散,n 個柯西樣本的平均並不比單一樣本更準確,不論 n 多大。大數法則乾脆不適用,而中央極限定理失效,因為它需要有限變異數。
實務上的教訓:選擇適合形狀的摘要。對對稱、輕尾的資料,均值是理想的。對偏態或重尾資料——所得、城市規模、保險損失、檔案大小、金融崩盤——中位數(與其他分位數)誠實得多,而你應該明確報導尾部行為,而非把它藏在一個數字背後。均值是工具,不是神諭;知道它何時失靈,是善用它的一部分。
平均 100 個隨機人的身高——這個平均穩如磐石而有意義。平均 100 個隨機人的淨資產——一個離群的億萬富翁就能讓均值翻好幾倍,而中位數紋風不動。同樣的算術,但一個均值有資訊,另一個騙人。
在重尾下,中位數與分位數常常比均值誠實得多地描述資料。
柯西分配根本沒有均值——定義積分發散,所以平均更多樣本沒有幫助,大數法則不適用。重尾也使中央極限定理失效,因為它需要有限變異數。
又称
另见