評估與指標

統計顯著性(statistical significance)

/ stuh-TIS-tih-kul sig-NIF-ih-kunss /

你的新模型得了91%,舊的得了90%。它是真的更好,還是只是在你恰好用上的那批特定測試樣本上走了運?統計顯著性,就是把「真實差異」從「隨機運氣」中分辨出來的那套學問。它問的是:假如本來根本沒有差異,單憑偶然,產生出這麼大、甚至更大的差距,會有多頻繁?

那個「多頻繁」由p值來刻畫。一個小的p值(約定俗成的切分線是0.05)意味著「這麼大的差距,純靠偶然很少會出現」,於是這差異被稱為「統計顯著」——多半是真的。一個大的p值則意味著,這差距完全落在「光靠運氣也能搞出來」的範圍之內,所以你不能宣稱有真正的進步。關鍵在於,這極度依賴樣本量:一個極小的測試集會讓一切都看起來像噪聲,而一個巨大的測試集,則可能連微不足道的差異都標為顯著。

下面這條提醒幾乎絆倒每一個人,而它至關重要。統計顯著,並不等於重要。只要數據足夠多,一個微乎其微的進步——比方說0.01%——可以高度顯著,在實踐中卻毫無意義。而且顯著性對「你的實驗設計得好不好」隻字不提;垃圾進,顯著的垃圾出。更糟的是,如果你測了許多種變體,卻只報那些恰好顯著的(這叫「p值篡改」p-hacking),你就會製造出虛假的發現。顯著性是一道「別用運氣騙了自己」的防線——但它絕不是真理或價值的印章。

在50個測試項上模型A比模型B高1分——只要換掉幾個項,這點領先就沒了,於是p=0.4:不顯著。同樣的1分差距,若在50000個項上測量、且穩穩地保持著,則給出p=0.001:顯著。同樣的差距,相反的判決——是樣本量在做決定。

同一個差異,在小數據上可能是噪聲,在大數據上卻很扎實。

要抵制兩個長盛不衰的混淆。其一,p值不是「你的假設為真的機率」——它是「假如根本沒有真實效應,看到如此極端數據的機率」。其二,「顯著」不等於「大」或「重要」;永遠要把效應量和p值一併報出,並對你究竟測了多少種東西保持誠實。

又稱
统计显著性統計顯著性p-valuep值significance test显著性检验