互資訊(mutual information)
如果我告訴你 X 的值,那會把你對 Y 的不確定減少多少?互資訊回答的正是這個:它以位元量化「知道一個隨機變數能告訴你關於另一個多少」。它是相關的資訊理論表親,卻普遍得多——它偵測兩變數之間「任何」種類的統計相依,而不只是直線關係。
有兩種等價的讀法,兩者都富啟發。作為不確定的減少:I(X; Y) = H(Y) - H(Y given X),即 Y 的熵減去「已知 X 後仍殘留的 Y 的熵」——學到 X 所消除的、關於 Y 的驚訝。由對稱性它等於 H(X) - H(X given Y),所以 X 給出關於 Y 的資訊,等於 Y 給出關於 X 的資訊。作為散度:I(X; Y) = 聯合分布 p(x, y) 對邊際乘積 p(x) p(y) 的 KL——它量的是 X 與 Y 離獨立有多遠,因為獨立恰好就是聯合因子分解成乘積之時。無論哪種讀法,公式都是 I(X; Y) = 對 x, y 求和 p(x, y) log[ p(x, y) / (p(x) p(y)) ]。互資訊永遠大於或等於 0,且當且僅當 X 與 Y 獨立時等於 0。
這使它成為相依重要之處的一件利器:機器學習中的特徵選取(保留對目標最有資訊的輸入)、量度通訊的通道容量、醫學影像配準,以及量化一個神經元的脈衝對一個刺激編碼了多少。它相較於相關係數的一大優勢,是對非線性的誠實——兩個變數可以有零相關卻有大的互資訊,例如 X 對稱於零時的 Y = X^2,其中關聯完美卻是彎的。提醒:I = 0 意味著真正的統計獨立(比零相關更強),但要從有限資料可靠地估計互資訊,尤其對連續變數,是真的很難且容易有偏。
令 X 是一枚公正硬幣(正/反),且令 Y 永遠等於 X(一份完美的複本)。則知道 X 消除了關於 Y 的「全部」不確定,所以 I(X; Y) = H(Y) = 1 位元。若改成 Y 是一次獨立的擲幣,學到 X 對 Y 一無所告,I(X; Y) = 0。真實的相依落在中間,而且與相關不同,它也能逮到彎曲的關係。
互資訊是「知道 X 所消除的、關於 Y 的不確定」;為零意味著獨立。
互資訊恰好在兩變數獨立時為零,所以與相關不同,它能偵測非線性相依(如 Y = X^2)——但從有限資料準確估計它,尤其對連續變數,是困難且有偏的。