次指數隨機變數(sub-exponential random variable)
次指數隨機變數的尾巴至少以指數速度衰減,對於大的 t,P(|X| > t) <= 2 e^(-c t)——比高斯重,但仍輕到足以得到尖銳的集中。一旦做乘法,這一類就被強制出現:次高斯的平方、或兩個次高斯的乘積,是次指數而非次高斯。由於卡方變數、樣本變異數,以及驅動共變異數估計的二次型恰好正是這類平方,次指數集中才是高維統計中真正需要的主力,即便輸入是高斯的也一樣。
與次高斯一樣,數個條件在絕對常數意義下等價:上述指數尾;動差增長 (E[|X|^p])^(1/p) <= K p(對 p 是線性,相對於次高斯的 sqrt(p));E[exp(|X| / K)] <= 2;以及對於置中的 X,一個只在原點鄰域成立的動差母函數界:對所有 |lambda| <= 1/K,E[exp(lambda X)] <= exp(K^2 lambda^2 / 2)。最後那個限制 |lambda| <= 1/K 正是與次高斯情形的全部差別,後者的二次動差母函數界對每個 lambda 都成立。由於動差母函數只在 0 附近受控,由此得到的集中具有兩個區段,而次指數變數在遠離原點處甚至不必有有限的動差母函數。
兩區段結構是次指數世界的標誌。對於獨立置中次指數之和的 Bernstein 不等式為 P(|sum| >= t) <= 2 exp(-c min(t^2 / sigma^2, t / b)),其中 sigma^2 是次指數變異數之和,b 是最大尺度。對於小偏差 t,高斯項 t^2/sigma^2 主導(次高斯行為);對於大的 t,線性指數項 t/b 接管,反映較重的尾。次高斯變數恰恰是其兩區段永不分離的次指數變數(b 可取與 sigma 成比例)。乘積刻畫是最乾淨的記法:X 是次指數,當且僅當 X = YZ 其中 Y、Z 為次高斯(啟發式地),且 ||X||_psi1 <= ||Y||_psi2 ||Z||_psi2。
若 g ~ N(0,1),則 X = g^2 - 1(置中卡方項)是次指數而非次高斯:其動差母函數 E[exp(lambda(g^2-1))] = exp(-lambda)/sqrt(1-2lambda) 僅在 lambda < 1/2 時有限,並在 lambda = 1/2 處發散。對 n 個這樣的項求和並套用 Bernstein 得 P(|sum (g_i^2 - 1)| >= n eps) <= 2 exp(-c n min(eps^2, eps))。
高斯的平方是次指數的:動差母函數只在原點附近存在。
與次高斯的關鍵差別:二次動差母函數界只對 |lambda| <= 1/K 成立,並非對所有 lambda。這正是 Bernstein 有兩個區段的原因,也是你不能在 Chernoff 最佳化中把 lambda 推到無窮的原因。