統計、資料與建模

不偏性、相合性與有效性

/ BY-us, kun-SIS-ten-see, eff-ISH-en-see /

把估計量想像成一位向靶子射箭的弓箭手:靶心是未知的真值,每一支箭是來自一個樣本的估計。三個獨立的問題描述了這位弓箭手有多好。箭是否以靶心為中心,還是系統性地偏向一側?隨著弓箭手用更大的弓射出越來越多的箭,它們是否會逐漸逼近靶心?而在所有都射得正中的弓箭手裡,誰的箭落得最為密集?這三個問題,就是不偏性、相合性與有效性。

偏差是估計量產生的平均值與真值之間的差;不偏估計量的偏差為零,即便單次射擊會脫靶,平均而言仍命中靶心。相合性意味著當樣本量無限增大時,估計量會收斂到真值——給它無限的資料,它就給出正確答案。有效性比較的是相互競爭的估計量的散佈(變異數):有效的那個變異數最小,因此能用同樣的資料最緊地鎖定真值。一個微妙之處是:這是三種不同的優點。常用的樣本變異數用 (n 減 1) 而非 n 來除,正是消除偏差的著名修正;一個估計量可以有偏卻相合,也可以不偏卻雜訊大得無可救藥。

精算師關心這些,是因為真實的決策建立在估計出的費率與準備金之上,而這三種性質告訴你該信任哪個估計量。這裡常存在權衡:一個略有偏差但變異數小得多的估計量,可以勝過一個不偏卻抖動劇烈的估計量,這種平衡由均方誤差(偏差的平方加變異數)來刻畫。這正是信度加權與現代收縮方法背後的邏輯——它們刻意接受一點偏差,以換取大量的穩定性,遠比一個「純粹」卻極不穩定的估計有用。

用平方離差除以 n 來估計投資組合的變異數,平均而言會低估它——這是一個微小卻真實的偏差。改用 (n 減 1) 來除則消除了這種偏差,這正是軟體預設採用 (n 減 1) 版本的原因。

(n 減 1) 這個除數,是從估計量中消除偏差的教科書範例。

不偏不等於最好。一個變異數小得多的有偏估計量,整體誤差(均方誤差)往往更低——這正是信度與收縮方法的全部要點。

又稱
estimator propertiesunbiasedness估计量的性质估計量的性質