数学基础

正态分布(normal distribution)

/ NOR-mul dis-truh-BYOO-shun /

正态分布就是那条著名的钟形曲线:一座对称的小山包,把大部分概率都堆在中间附近,再朝两端平滑地收细。身高、测量误差、考试分数,以及数不清的其它自然量,散布出来都大致是这个形状——围着一个典型值扎堆,而异常大和异常小的,越往外走就越稀罕。

只要两个数,就能把它彻底定死。均值固定了峰顶坐落在哪儿——也就是「重心」。标准差则决定这口钟有多宽、多扁——标准差小,就是一根又高又窄的尖峰(一切都紧紧挤作一团);标准差大,就是一座又矮又阔的土丘(取值散得满世界都是)。一条好用的经验法则:大约 68% 的数据落在均值上下一个标准差之内,约 95% 落在两个标准差之内,约 99.7% 落在三个标准差之内。

它之所以在统计与机器学习里占尽风头,背后有个深刻的缘由,叫中心极限定理:当你把许许多多微小、彼此独立的随机效应加在一起时,无论这些零件原本来自何方,其总和都会趋向钟形。所以误差、噪声与各种合计量,自然而然就落在这里。模型也时时刻刻倚靠着它——把它当作噪声假定的形状、当作给网络权重撒下的初始随机分布、当作高斯混合里的那口钟。一句老实的警告:现实中有大把数据根本就不是正态的。收入、城市规模、股市崩盘都有「肥尾」,那里罕见的极端事件出现得远比钟形曲线所预言的频繁,在那种地方硬套正态,可能会误导得相当危险。

假设成年人身高平均为 170 厘米,标准差为 7 厘米。那么大约 68% 的人身高在 163 到 177 厘米之间,约 95% 在 156 到 184 厘米之间,而身高超过 191 厘米(高出三个标准差)的人就真的罕见了——大致是高个一端千分之一的水平。

68-95-99.7 法则:钟形曲线的绝大部分质量,都落在均值上下一个、两个、三个标准差之内。

别因为钟形曲线用起来方便,就想当然地认定你的数据是正态的——现实世界里许多量都有「肥尾」,极端事件在那里出现的频率远超正态分布所允许的,而这个错误已经葬送过不止一个金融模型。

又称
正态分布常态分布常態分布Gaussian distribution高斯分布bell curve钟形曲线