母體與樣本
/ POP-yuu-LAY-shun vurs SAM-pul /
假設你想知道某個國家所有成年人的平均身高。把每個人都量一遍是不可能的——有幾百萬人,而且每天都有人出生、有人去世。於是你改為仔細挑選幾千個人來測量,並用這個較小的群體來對所有人下結論。你真正關心的整個群體叫做母體;你實際觀察到的較小群體叫做樣本。統計學幾乎全部的內容,都生活在這兩者之間的縫隙裡。
更精確地說,母體是問題所涉及的全部個體的完整集合——每一位保單持有人、每一筆可能發生的理賠、骰子每一次可能的點數——連同描述它的真實數字。這些真實數字,比如母體均值或母體變異數,稱為參數,它們通常是固定卻未知的。樣本是我們觀察到的一個子集,由樣本算出的數字,比如樣本均值,稱為統計量。我們用統計量來估計參數。一個關鍵觀念是:如果我換一個樣本來抽,就會得到不同的樣本均值,儘管母體均值從未改變。樣本是隨機的;母體不是。
對精算師而言,這一區分是一切的基石。所謂「母體」,可能是某張死亡率表想要描述的所有生命,或是該保險組合將來可能產生的每一筆車險損失;而「樣本」則是公司實際收集到的那一疊有限的資料。整門手藝,就是從有限、甚至可能有偏的樣本,對看不見的母體得出誠實的結論。最深的危險,是樣本無法代表母體——例如,僅用留存下來的保單持有人(倖存者)來估計未來理賠,會悄悄地扭曲整幅圖景。
保險公司無法知道它將來可能承保的每一位司機的真實平均理賠(母體)。它手上有去年實際發生的 5 萬筆理賠(樣本),求出平均值 1,820 美元,並把這個數字當作對母體真實平均理賠的最佳猜測。
樣本均值(1,820 美元)是已知的統計量;它所估計的母體均值則是未知的。
更大的樣本能減少隨機誤差,卻完全無法修正「有偏」的樣本。如果只有接電話的人才在其中,那麼一百萬份電話調查回覆,對整個國家仍然毫無用處。