伯恩斯坦不等式(Bernstein's inequality)
/ BERN-styne /
霍夫丁不等式很大方,卻對一件事視而不見:即使一個變數幾乎總是靠近它的均值,它仍按整個可能範圍向你收費。想像把一些量測加總,它們通常是 0,卻極罕見地跳到 100。它們的範圍很大,但典型的散布很小。伯恩斯坦不等式正是那把更銳利的工具,讓變異數——而不只是範圍——來控制這個界。
敘述如下,對獨立的零均值變數、每個都滿足 |X_i| <= M、總變異數 V = 對 Var(X_i) 求和:P(sum X_i >= t) <= exp( -t^2 / (2V + (2/3) M t) )。讀懂分母的兩塊。對小偏離 t,2V 項主導,界看起來像高斯——exp(-t^2 / 2V),由變異數驅動,正是霍夫丁錯過的那個銳利區段。對大 t,M t 項接手,衰減僅變成 t 的指數,exp(-(3/2) t / M),反映出一個雖重但有界的尾部,衰減快不過有界性所允許的程度。這種從類高斯到類指數的轉換,正是伯恩斯坦的招牌。
它何時要緊:當變異數遠小於範圍時——稀疏計數、罕見事件、低雜訊迴歸——伯恩斯坦可以比霍夫丁緊上許多,常把所需樣本數改善數個數量級。它是高維統計與學習理論裡的標準集中工具。代價是你必須真的知道(或界定)變異數,並且需要有界性 M;霍夫丁要求得較少,而伯恩斯坦則因你知道得更多而給予回報。
把 n 個獨立的罕見事件加總,每個以微小機率 p 為 1、否則為 0,故 M = 1 且總變異數 V ≈ np。對小 t,界表現得像 exp(-t^2 / (2np))——由真實變異數 np 控制——遠比霍夫丁的 exp(-2 t^2 / n) 緊,後者用了整個範圍卻無視事件有多罕見。
由變異數(而非僅範圍)驅動的界:小偏離時類高斯,大偏離時呈指數。
伯恩斯坦同時需要變異數的界與有界性常數 M。它勝過霍夫丁的優勢,只在變異數遠小於範圍時才顯現;否則兩者相當。