大偏差理論

Cramer 定理(Cramer's theorem)

/ KRAH-mair /

Cramer 定理是大偏差的奠基結果:它給出獨立同分布隨機變數的經驗平均偏離其期望值的精確指數速率。它是大數法則的大偏差類比,回答了大數法則提出卻未處理的問題——不只是平均會集中,而是固定大小的偏差有多麼天文數字般地不可能,以及由什麼支配。

設 X_1, X_2, ... 為獨立同分布實隨機變數,S_n = (X_1 + ... + X_n)/n 為經驗平均。Cramer 定理陳述 S_n 的分布滿足速度為 n、速率函數 I 由對數動差母函數的勒讓德-芬切爾變換給出的大偏差原理:I(x) = 對 theta 取上確界的 (theta x - log E[e^(theta X_1)])。速率函數是凸的、非負的,且恰在平均 E[X_1] 處為零。速率函數背後的直觀是指數傾斜:要使經驗平均落在非典型值 x 附近,最低成本的機制是把真實分布換成指數傾斜(Cramer 變換)分布 dmu_theta 正比於 e^(theta X) dmu,選 theta 使 x 成為新的平均;此測度變換的成本(以相對熵衡量)恰為 I(x)。

Cramer 定理在 R 上於溫和條件下成立,並在對數動差母函數於原點鄰域內有限時延拓至 R^d(R^d 中的 Cramer)以及可分巴拿赫空間(Cramer-Donsker-Varadhan),此條件保證所有指數動差與良好速率函數。若動差母函數僅在原點有限(重尾),Cramer 定理的經典指數形式失效,偏差改為遵循多項式的「大跳躍」原理——偏差不是由許多小貢獻而是由單一大加項所實現。因此輕尾假設不可默默地拋棄。

對於獨立同分布 Exponential(1) 變數,當 theta < 1 時 log E[e^(theta X)] = -log(1 - theta),故對 x > 0 有 I(x) = sup_theta (theta x + log(1 - theta)) = x - 1 - log x。它在 x = 1(平均)處為零,並告訴你例如 n 個指數變數的平均超過 2 的機率大致以 e^(-n(1 - log 2)) = e^(-0.307 n) 衰減。

Cramer:速率是對數動差母函數的勒讓德變換。

輕尾(0 附近有限指數動差)假設是必要的。對重尾加項,罕見偏差由單一大跳躍主宰,衰減是多項式而非指數,Cramer 的指數速率函數無法描述它。

又稱
Cramér's theorem克拉默定理