收斂模式與極限定理

貝里-埃森定理(the Berry-Esseen theorem)

/ BERR-ee ess-AYN /

中央極限定理承諾標準化的和在極限上看起來像常態——但實際工作的科學家想要更多:在某個特定的、有限的 n 上,它「有多」接近常態?這個近似在 n = 30 時可信嗎,還是要到 n = 3000?貝里-埃森定理正好回答這個問題。它替真實分布與其常態近似之間的差距,釘上一個具體、可計算的數字。

精確地說:設 X_1, ..., X_n 獨立同分布,均值 mu、變異數 sigma^2,且第三絕對動差 rho = E[|X - mu|^3] 有限。令 F_n 為標準化和的 CDF,Phi 為標準常態 CDF。則兩者間最大的差異有界:對所有 x 取上確界 |F_n(x) - Phi(x)| <= C * rho / (sigma^3 * sqrt(n)),其中 C 是一個普適常數(已知低於約 0.47)。讀懂這訊息:誤差以 1/sqrt(n) 縮小——樣本變四倍,差距減半——而當資料更偏斜(rho 相對 sigma^3 大)時誤差更大。1/sqrt(n) 這個速率是頭條。

為什麼重要、又在哪裡咬人。貝里-埃森把 CLT 從一個極限承諾變成一份可用的誤差預算,支撐起誠實的信賴區間與樣本量選擇。兩個提醒讓你保持誠實。第一,它需要有限的「第三」動差,比 CLT 的有限變異數前提更多。第二,1/sqrt(n) 是對整個分布的最壞情況速率,往往偏悲觀——但它也警告:即使中央極佳,近似的尾端仍可能很差,所以常態近似在主體最可信,在遠尾最不可信。

對擲幣計數(n 次 Bernoulli(0.5) 之和)而言,貝里-埃森界約為 0.47/sqrt(n):n = 30 時約 0.085,n = 300 時約 0.027。所以二項分配的常態近似穩定但緩慢地改善——資料多十倍,最壞情況誤差也只減少約三倍。

CLT 對常態的誤差以 1/sqrt(n) 縮小,並隨偏態增大——n 變四倍只把差距減半。

貝里-埃森需要有限的第三動差,比 CLT 更強。1/sqrt(n) 是對所有 x 的最壞情況速率,往往偏保守,尤其在分布主體處。

又稱
Berry-Esseen boundrate of convergence in the CLT貝里-埃森界CLT 收斂速率定理