隨機變數的函數與變換
樣本全距(sample range)
描述一個樣本散得多開、最簡單的單一數字,就是從它的最小值到最大值的距離:樣本全距。若今天的氣溫從 12 度到 27 度,全距就是 15。它計算快、易解釋,這就是為何品管圖與天氣報告都倚賴它。
嚴格地說,全距是 R = X_(n) - X_(1),最大的順序統計量減去最小的。由於它由兩個本身相依的順序統計量構成,求它的分布需要一點小心:你從最小值與最大值的聯合分布出發(對獨立同分布樣本有已知形式),再求它們之差的分布。結果取決於底層分布 F,且平均而言隨樣本數 n 增加而增大 —— 更多抽樣給出更多出現極高與極低的機會,把差距拉寬。
兩個誠實的提醒。全距只用兩個數字、丟掉中間的一切,所以它是粗糙又脆弱的散布量測 —— 單一個離群值就能把它撐大,且對小樣本它幾乎總是低估真實散布,對大樣本卻又往上漂。需要仔細的工作通常偏好標準差或四分位距;全距主要在速度與簡單最重要時才有價值。
對五個 (0, 1) 上的獨立均勻變數,全距的期望值為 (n - 1)/(n + 1) = 4/6 = 2/3。注意它小於完整區間長度 1:只有五次抽樣時,你很少剛好打到 0 與 1 處的值,所以觀測到的散布通常會低估真實跨度。
對小樣本,全距會低估真實散布,因為極端值很少被達到。
全距只取決於兩個極端值,所以對離群值極為敏感,且忽略了資料的主體。多數用途下,標準差或四分位距是更可靠的散布量測。
又称
另见