變異數代理(variance proxy)
變異數代理是量化一個變數有多次高斯的參數,也是貫穿每一個 Hoeffding 型界的單一數值。對於置中隨機變數 X,若對所有實 lambda 有 E[exp(lambda X)] <= exp(sigma^2 lambda^2 / 2),我們說 X 是次高斯且變異數代理為 sigma^2。這個名稱是刻意的:真正的高斯 N(0, sigma^2) 以等號達到此式,因此即便 X 遠非高斯,sigma^2 仍扮演高斯之真變異數的角色。
代理是實際變異數的上界,絕不會低於它:Var(X) <= sigma^2,因為在 lambda = 0 處對動差母函數不等式微分兩次給出 E[X^2] <= sigma^2。但代理可以嚴格大於變異數。Rademacher 符號的變異數為 1、代理也恰為 1(緊密相符),但一個集中在 +/-1 附近、別處帶微小質量的變數,其變異數可略小於 1,而其代理卻被那些在大 lambda 下主導動差母函數的罕見大值逼高。代理是尾巴所見的;變異數只是二階動差所見的。對於 [a,b] 有界變數,Hoeffding 引理給出代理 (b-a)^2/4,它可能遠大於真變異數——這個差距是 Hoeffding 忽略變異數所付的代價,也正是 Bernstein 與 Bennett 所要找回的。
代理之所以重要,是因為可加性。對於獨立置中次高斯 X_1、…、X_n,其代理為 sigma_1^2、…、sigma_n^2,動差母函數相乘,故和的代理為 sigma_1^2 + ... + sigma_n^2——恰如獨立變數的變異數相加。把這個求和後的代理代入 Chernoff 界即得一般 Hoeffding 不等式 P(sum >= t) <= exp(-t^2 / (2 sum sigma_i^2))。整個次高斯集中的邏輯是:辨識變異數代理、把它們加總、對 lambda 最佳化。誠實的提醒是:代理是控制偏差的量,當它高估變異數時你的尾界就鬆;更尖銳的不等式(Bernstein、Bennett、熵方法)之所以存在,正是為了改用真變異數而非可能過於悲觀的代理。
取一枚以機率 p 為 1、以機率 1-p 為 -1 的硬幣(故未置中);置中後 X = sign - (2p-1)。其變異數為 4p(1-p),當 p 接近 0 或 1 時極小,然而對有界變數 Hoeffding 仍用代理 1(值域 = 2,故 (b-a)^2/4 = 1)。代理忽略了極偏的硬幣幾乎不波動——這正是 Bernstein 之變異數感知界所去除的鬆弛。
代理是變異數的上界,當變數高度偏倚時可能大得多。
永遠是 Var(X) <= sigma^2,絕非反向;最佳(最小)代理才使界緊。常見錯誤是把 sigma^2 稱為「變異數」——它是代理,而它超出真變異數時的鬆弛正是人們從 Hoeffding 升級到 Bernstein 的原因。