高維機率與集中

奧利奇範數(Orlicz norm)

/ OR-litch /

奧利奇範數是把「次高斯」與「次指數」這兩個定性類別轉化為誠實範數的工具——可以相加、伸縮與比較的數值。一旦有了範數,次高斯變數構成一個巴拿赫空間,和可由三角不等式控制,上百個集中論證就變成例行的記帳。對集中而言重要的兩個範數是 psi_2(次高斯)範數與 psi_1(次指數)範數,分別由楊氏函數 psi_2(x) = e^(x^2) - 1 與 psi_1(x) = e^x - 1 建構。

對於楊氏函數 psi(凸、遞增、psi(0)=0),X 的奧利奇範數為 ||X||_psi = inf{ t > 0 : E[psi(|X|/t)] <= 1 }。下確界挑出最小尺度 t,使得重新縮放後的隨機變數其期望奧利奇成本至多為 1。具體地,||X||_psi2 = inf{ t > 0 : E[exp(X^2/t^2)] <= 2 } 是次高斯範數,||X||_psi1 = inf{ t > 0 : E[exp(|X|/t)] <= 2 } 是次指數範數。一個變數是次高斯當且僅當 ||X||_psi2 < 無窮,是次指數當且僅當 ||X||_psi1 < 無窮;這些有限範數(在絕對常數意義下)等價於各自定義中的動差增長與尾常數。兩者間的基本連結是 ||XY||_psi1 <= ||X||_psi2 ||Y||_psi2,尤其 ||X^2||_psi1 = ||X||_psi2^2,這是「次高斯的平方為次指數」的嚴格形式。

為何要範數而非常數?因為它讓操作變得乾淨。三角不等式讓你拆分誤差;置中只花費一個常數,||X - E[X]||_psi <= 2 ||X||_psi;而對於獨立置中次高斯,關鍵的可加性是 ||sum X_i||_psi2^2 <= C sum ||X_i||_psi2^2,這條變異數代理相加規則產生了 Hoeffding 界。範數在 E[psi(...)] <= 2 右側選 2(有些教科書用 1)所隱含的絕對常數意義下是唯一的;這正是貫穿整個主題的同一個無害常數模糊性。奧利奇範數也推廣了 L^p 尺度:||X||_psi 同時控制所有 L^p 範數,這恰是動差增長刻畫。

對於 X ~ N(0, sigma^2),E[exp(X^2/t^2)] = (1 - 2 sigma^2/t^2)^(-1/2),當 t^2 = 8 sigma^2 / 3 時等於 2,故 ||X||_psi2 = sigma sqrt(8/3) ~ 1.63 sigma——有限且與 sigma 成比例,正如次高斯範數應有的樣子。Rademacher 符號則有 ||X||_psi2 = 1/sqrt(log 2)。

高斯的 psi_2 範數是其標準差的固定倍數。

奧利奇範數的確切數值取決於慣例(右側用 2 還是 1,以及用 psi(x)=e^(x^2)-1 還是 e^(x^2));只有在絕對常數意義下的等價類是典範的。不要跨教科書比較 psi 範數而期望得到相同數字。

又称
psi_2 normpsi_1 normsub-Gaussian normsub-exponential normpsi 範數