數學基礎

常態分布(normal distribution)

/ NOR-mul dis-truh-BYOO-shun /

常態分布就是那條著名的鐘形曲線:一座對稱的小山包,把大部分機率都堆在中間附近,再朝兩端平滑地收細。身高、測量誤差、考試分數,以及數不清的其它自然量,散布出來都大致是這個形狀——圍著一個典型值扎堆,而異常大和異常小的,越往外走就越稀罕。

只要兩個數,就能把它徹底定死。均值固定了峰頂坐落在哪兒——也就是「重心」。標準差則決定這口鐘有多寬、多扁——標準差小,就是一根又高又窄的尖峰(一切都緊緊擠作一團);標準差大,就是一座又矮又闊的土丘(取值散得滿世界都是)。一條好用的經驗法則:大約 68% 的資料落在均值上下一個標準差之內,約 95% 落在兩個標準差之內,約 99.7% 落在三個標準差之內。

它之所以在統計與機器學習裡佔盡風頭,背後有個深刻的緣由,叫中心極限定理:當你把許許多多微小、彼此獨立的隨機效應加在一起時,無論這些零件原本來自何方,其總和都會趨向鐘形。所以誤差、雜訊與各種合計量,自然而然就落在這裡。模型也時時刻刻倚靠著它——把它當作雜訊假定的形狀、當作給網路權重撒下的初始隨機分布、當作高斯混合裡的那口鐘。一句老實的警告:現實中有大把資料根本就不是常態的。收入、城市規模、股市崩盤都有「肥尾」,那裡罕見的極端事件出現得遠比鐘形曲線所預言的頻繁,在那種地方硬套常態,可能會誤導得相當危險。

假設成年人身高平均為 170 公分,標準差為 7 公分。那麼大約 68% 的人身高在 163 到 177 公分之間,約 95% 在 156 到 184 公分之間,而身高超過 191 公分(高出三個標準差)的人就真的罕見了——大致是高個一端千分之一的水平。

68-95-99.7 法則:鐘形曲線的絕大部分質量,都落在均值上下一個、兩個、三個標準差之內。

別因為鐘形曲線用起來方便,就想當然地認定你的資料是常態的——現實世界裡許多量都有「肥尾」,極端事件在那裡出現的頻率遠超常態分布所允許的,而這個錯誤已經葬送過不止一個金融模型。

又稱
正态分布常态分布常態分布Gaussian distribution高斯分布bell curve钟形曲线