應用:貝氏推論、資訊與模擬

夏農熵(Shannon entropy)

/ SHAN-un /

當你得知一個隨機事件的結果時,平均而言你有多驚訝?一枚你早知會出正面的硬幣不帶驚訝;一顆公正的骰子帶一些;一次樂透開獎帶很多。夏農熵量的正是這份平均驚訝——等價地,是你從觀測結果所得的平均資訊量;又等價地,是平均要問多少個是非題才能把結果釘下來。

從一個想法建起它:愈不可能的結果愈令人驚訝。把一個機率為 p 的結果的驚訝量化為 log(1/p) = -log p(罕見事件,大驚訝;必然事件 p = 1,零驚訝)。一個分布的熵就是平均驚訝:H(X) = -對 x 求和 p(x) log p(x)。用以 2 為底的對數,單位就是位元(bit)。一枚公正硬幣有 H = -[0.5 log2 0.5 + 0.5 log2 0.5] = 1 位元——值一個是非題。一顆公正骰子有 log2 6 約 2.58 位元。熵在分布為均勻時最大(最大不確定,所有結果等可能),在某個結果為必然時為零(毫無不確定)。加入更多等可能的結果會使它升高。

這一個數字是資訊理論的地基,並在機率遇上計算之處無所不在。夏農的來源編碼定理把它具體化:H(X) 是編碼 X 的結果所需的最小平均位元數——你無法在不丟失資訊的情況下壓縮到熵以下,這正是為什麼一個近乎均勻的檔案幾乎壓不動,而一個偏斜的檔案能縮很多。在機器學習裡,最小化交叉熵損失用來訓練分類器;在物理裡,同一個公式(差一個常數)就是熱力學熵。誠實的提醒:熵量的是不確定性,不是價值或意義——一串純粹的隨機雜訊有最大的熵,卻不攜帶任何有用的訊息,所以夏農意義下的「高資訊」並不等於「有用」。

兩座城市的天氣預報。A 城有 90 百分比的日子是晴:它的結果幾乎確定,所以熵低,只約 0.47 位元——知道預報幾乎沒告訴你新東西。B 城恰好一半的日子是晴:兩個結果下的最大不確定,熵恰為 1 位元——每天的天氣都是真正的驚訝,攜帶整整一個位元的資訊。

熵是平均驚訝,在均勻分布時最大,對必然之事為零。

熵量的是不確定性,不是有用性:純隨機雜訊有最大可能的熵,卻不攜帶任何有意義的訊息,所以高的夏農資訊並不等於有價值的資訊。

又称
entropyinformation entropy資訊熵