假設檢定、p 值與顯著性
/ hy-POTH-eh-sis; PEE-value /
假設一條新的核保規則本應降低理賠。一年之後,理賠略有下降——但這是真實的效應,還是只是運氣使然、那種即便規則毫無作用也會因偶然而出現的下滑?假設檢定正是為這個問題設立的正式「法庭」。它先假定那個無趣的解釋為真(規則毫無作用),然後追問:資料是否太過出人意料,以致無法與這一假定相容?
那個無趣的解釋是虛無假設(零假設);有趣的那個是對立假設。我們計算一個檢定統計量,衡量資料離虛無假設所預測的有多遠,再算出 p 值:在虛無假設為真的前提下,看到至少這般極端的資料的機率。小的 p 值(通常低於 0.05)意味著資料在虛無假設下會令人意外,於是我們「拒絕虛無假設」,並稱結果具有統計顯著性。例如,p 值為 0.01 表示:在虛無假設下,純粹由偶然產生如此驚人結果的情形只佔 1%。至關重要的是,大的 p 值並不能證明虛無假設——它只是未能提供反對它的證據。
精算師用這些檢定來追問:某個費率變數是否真的影響損失、觀察到的死亡率是否不同於標準表、某個模型項是否配得上它的位置。但這套框架被廣泛濫用,因此誠實地使用它需要謹慎。0.05 這個分界線是任意的約定,而非自然法則。統計顯著性不等於實際重要性——資料足夠多時,一個微不足道、毫無用處的差異也會變得「顯著」。而 p 值既不是虛無假設為真的機率,也不是你的發現純屬偶然的機率;它是在假定虛無假設下關於資料的一項陳述。做很多次檢定卻只報告顯著的那些(p 值操縱)會製造出虛假的發現。
精算師檢定某地區的死亡率是否超出標準表。檢定給出 0.002 的 p 值,遠低於 0.05,故這一超額具有統計顯著性——該地區看來確實死亡率偏高,而不只是運氣不好的一年。
小的 p 值,標示出一個極端到難以心安理得歸咎於偶然的結果。
統計顯著性不等於實際重要性,p 值也不是虛無假設為真的機率。資料量極大時,一個毫無意義的差異也可能「高度顯著」。