大偏差理論

相對熵作為速率函數(relative entropy as a rate function)

相對熵——Kullback-Leibler 散度 H(nu | mu)——是 Sanov 定理中的速率函數,將它辨認為大偏差成本,正是賦予這個原本屬於資訊理論的量其最銳利機率意義之處。它回答:在所有分布中,n 個獨立同分布 mu 樣本產生類似 nu 的經驗直方圖在指數上有多昂貴?答案是 e^(-n H(nu|mu)),因此相對熵正是把 mu 假裝成 nu 的每樣本指數代價。

nu 相對於 mu 的相對熵,當 nu 對 mu 絕對連續時為 H(nu | mu) = integral of log(dnu/dmu) dnu,否則為 +無窮。它非負(Gibbs 不等式),當且僅當 nu = mu 時為零,對 (nu, mu) 聯合凸,且在弱拓樸下下半連續並具緊下水平集——恰是良好速率函數的性質,這也是 Sanov 定理產生良好大偏差原理的原因。它不對稱也不是度量:H(nu|mu) 一般不同於 H(mu|nu),反映「在 mu 取樣下 nu 有多罕見」這個本質上有方向性的不對稱問題。

它的角色貫穿整個主題。Cramer 速率函數 I(x) = sup_theta(theta x - log M(theta)) 等於在所有平均為 x 的 nu 上對相對熵 H(nu|mu) 取的最小值,這個變分形式使指數傾斜成為最佳化子。Donsker-Varadhan 變分公式把 H(nu|mu) = 對有界 f 取上確界的 (integral f dnu - log integral e^f dmu) 表達為 Varadhan 引理的精確對偶。而 Gibbs 條件化原理說受約束的系統會弛豫到相對熵極小化子,這正是系統在約束下最大化熵的統計力學陳述。相對熵是連結大偏差、資訊理論與平衡統計力學的線索。

對兩個伯努利分布,nu = Bernoulli(p) 與 mu = Bernoulli(q),H(nu|mu) = p log(p/q) + (1-p) log((1-p)/(1-q))。當 q = 1/2 時它化為 p log(2p) + (1-p) log(2(1-p))——恰是大偏差原理條目中的擲幣速率函數,證實 Cramer 的擲幣速率是 Sanov 相對熵的特例。

KL 散度是把 mu 誤認為 nu 的指數成本。

相對熵不對稱且不是距離:H(nu|mu) 不是 H(mu|nu),且它違反三角不等式。把 KL 當作度量會導致錯誤直觀;它是有方向性的成本,其中 mu 是參考(取樣)分布。

又稱
Kullback-Leibler divergenceKL divergence相對熵KL散度