隨機變數的函數與變換
順序統計量(order statistics)
取一個由好幾個隨機測量值構成的樣本,把它們從小到大排好。排序後的值 —— 最小的、第二小的,一路到最大的 —— 就是順序統計量。它們把一袋無序的數字變成有排名的序列,正是你談論最小值、最大值、中位數、百分位數與全距時所需要的。
把排序後的樣本寫成 X_(1) at most X_(2) at most ... at most X_(n)。這裡 X_(1) 是最小值、X_(n) 是最大值。即使原始值是獨立同分布的,順序統計量彼此之間仍相依(第二小的不可能低於最小的),且各自有自己的分布。第 k 個順序統計量的 cdf 來自計數:X_(k) 不超過 x,恰好等於 n 個值中至少有 k 個不超過 x,而低於 x 的值的個數服從二項分配。這個計數給出任一排名分布的乾淨公式。
順序統計量是實用統計的骨幹:樣本中位數是中間的順序統計量,四分位數與百分位數都是順序統計量,兩端之間的散布就是樣本全距。它們也驅動極值理論 —— 洪水、破紀錄的氣溫、保險損失 —— 在那裡,大樣本中最大值的行為就是整個問題。
取五個考試分數的樣本:71、88、64、92、80。排序後,順序統計量為 X_(1) = 64(最小)、X_(2) = 71、X_(3) = 80(中位數)、X_(4) = 88、X_(5) = 92(最大)。全距為 X_(5) - X_(1) = 28。即使這些分數是獨立抽取的,這些排名位置仍綁在一起。
把樣本排序便產生順序統計量 —— 最小值、中位數、最大值,以及之間的一切。
來自獨立同分布樣本的順序統計量「彼此並不獨立」,儘管原始觀測值是獨立的。它們的聯合行為被排序本身所約束。
又稱
另見