评估与指标

统计显著性(statistical significance)

/ stuh-TIS-tih-kul sig-NIF-ih-kunss /

你的新模型得了91%,旧的得了90%。它是真的更好,还是只是在你恰好用上的那批特定测试样本上走了运?统计显著性,就是把「真实差异」从「随机运气」中分辨出来的那套学问。它问的是:假如本来根本没有差异,单凭偶然,产生出这么大、甚至更大的差距,会有多频繁?

那个「多频繁」由p值来刻画。一个小的p值(约定俗成的切分线是0.05)意味着「这么大的差距,纯靠偶然很少会出现」,于是这差异被称为「统计显著」——多半是真的。一个大的p值则意味着,这差距完全落在「光靠运气也能搞出来」的范围之内,所以你不能宣称有真正的进步。关键在于,这极度依赖样本量:一个极小的测试集会让一切都看起来像噪声,而一个巨大的测试集,则可能连微不足道的差异都标为显著。

下面这条提醒几乎绊倒每一个人,而它至关重要。统计显著,并不等于重要。只要数据足够多,一个微乎其微的进步——比方说0.01%——可以高度显著,在实践中却毫无意义。而且显著性对「你的实验设计得好不好」只字不提;垃圾进,显著的垃圾出。更糟的是,如果你测了许多种变体,却只报那些恰好显著的(这叫「p值篡改」p-hacking),你就会制造出虚假的发现。显著性是一道「别用运气骗了自己」的防线——但它绝不是真理或价值的印章。

在50个测试项上模型A比模型B高1分——只要换掉几个项,这点领先就没了,于是p=0.4:不显著。同样的1分差距,若在50000个项上测量、且稳稳地保持着,则给出p=0.001:显著。同样的差距,相反的判决——是样本量在做决定。

同一个差异,在小数据上可能是噪声,在大数据上却很扎实。

要抵制两个长盛不衰的混淆。其一,p值不是「你的假设为真的概率」——它是「假如根本没有真实效应,看到如此极端数据的概率」。其二,「显著」不等于「大」或「重要」;永远要把效应量和p值一并报出,并对你究竟测了多少种东西保持诚实。

又称
统计显著性統計顯著性p-valuep值significance test显著性检验