自助法(bootstrap)
你從資料算出了某個統計量——一個中位數、一個相關、一個比值——而現在你需要它的不確定性:一個標準誤或一個信賴區間。對一個簡單的平均有公式,但對一個複雜的統計量,公式可能根本不存在。自助法是一個出奇簡單的計算把戲,它把你那一份資料當成整個母體的替身、從中重抽樣,照樣得到不確定性。
這個程序簡單到幾乎可疑。從你原本 n 個資料點的樣本,用「放回」抽樣抽出一個 n 個點的「新」樣本(所以有些原本的點出現兩次或更多、有些則完全不出現)。在這個重抽樣上算你的統計量。把整件事重複很多次——比如一千次重抽樣——得到一千個重新算出的統計量值。那些自助值的散布,估計了你那個統計量的抽樣變異:它們的標準差是自助標準誤,而它們中間的 95 百分比(第 2.5 到第 97.5 百分位)構成一個自助信賴區間。其邏輯是,你資料的經驗分布是對真實分布最好的可得猜測,所以從你的資料重抽樣,模仿了從母體抽出新資料集。
自助法廣受喜愛,因為它幾乎一無所求:沒有公式、不假設常態、不必推導——就是重抽樣再重算,這正是為什麼它對中位數、修剪平均、相關係數,以及沒有可處理理論的量都管用。誠實的提醒不可或缺。它無法變出你樣本裡沒有的資訊,所以 n 很小時它不可靠。它對依賴極值的統計量(如最大值)或樣本對尾部代表性差的重尾資料可能嚴重失敗,而且它假設你的觀測是獨立的——對時間序列或叢集資料,天真的自助法是錯的,你需要專門的變體。
你有 50 個反應時間,想要它們中位數的一個信賴區間,而中位數沒有簡單公式。從你的 50 個值用放回抽樣重抽 50 個、取中位數;做這件事 2000 次。那 2000 個中位數的第 2.5 與第 97.5 百分位,給出真實中位數的一個 95 百分比自助區間——不需任何分布假設。
用放回抽樣重抽你的資料再重算;其散布估計了該統計量的不確定性。
自助法無法製造出超出你樣本之外的資訊:它對極小的 n 不可靠、對由極值驅動的統計量(如最大值)會失靈,而天真的版本假設觀測彼此獨立。