深度學習理論

資訊瓶頸理論(information bottleneck theory)

一個好的內部表徵,應該保留所有與標籤相關的東西,並丟掉輸入中其餘的一切。資訊瓶頸把這句口號變成一個目標:把輸入擠過一個表徵,讓它盡量保留關於目標的資訊,同時盡量少保留關於原始輸入的資訊。這個表徵字面上就是一個瓶頸,讓有預測力的訊號通過,並掐住其餘的部分。

形式上,這是在權衡兩個互資訊項:最小化「表徵保留了多少關於輸入的資訊」減去一個權重乘上「表徵保留了多少關於標籤的資訊」。Tishby 與合作者提出的著名主張是:隨機梯度下降訓練在資訊平面上會經過兩個可見的階段——一個快速的配適階段,提高相關資訊;接著是一個漫長的壓縮階段,降低輸入資訊,網路慢慢遺忘無關的細節。

這個框架在概念上很有說服力,也形塑了人們思考表徵學習的方式。但壓縮階段的主張確實有爭議:它是否出現取決於非線性,而在確定性的連續網路裡估計互資訊本身就很棘手,因此有幾個團隊無法重現它。把它當作一面有啟發性的鏡子,而不是已成定論的事實。

\min_{p(t\mid x)}\ I(X;T) - \beta\, I(T;Y)

資訊瓶頸目標:把輸入 X 壓縮成 T,同時保留關於標籤 Y 的資訊,以 β 來權衡。

壓縮階段是否存在仍有爭議,且取決於激活函數,以及在確定性網路中所用的互資訊估計子。

又稱
IB資訊瓶頸information plane