貝氏深度學習

知識不確定性與偶然不確定性(epistemic vs. aleatoric)

模型不確定的原因有兩種非常不同。偶然(aleatoric)不確定性是資料本身不可化約的雜訊:硬幣是公正的、感測器有顆粒、標籤本身模稜兩可,再多資料也消不掉。知識(epistemic)不確定性則是模型自己的無知:它在這個區域看過的資料太少,多收集一些就會縮小。把這兩者分開,正是不確定性量化的全部重點。

偶然不確定性靠讓模型預測自己的雜訊來捕捉,透過一個異質變異數(heteroscedastic)的輸出頭,或概似的散布。知識不確定性則住在參數後驗裡:它是各個合理模型之間的分歧,形式上是對參數積分所產生的預測變異數。一個標準的分解把總預測不確定性(熵)寫成期望偶然量(條件熵)加上知識量(預測與參數之間的互資訊)。

這個區分驅動決策:知識不確定性告訴主動學習該去哪裡收集資料、告訴分布外偵測何時該棄答,而偶然不確定性則告訴你可達誤差的下限。要提醒的是,這個切分是相對於模型的:在小模型看來偶然的東西,換個更好的模型也許就可化約,而許多便宜的方法把兩者混為一談。

\underbrace{H[y\mid x,\mathcal{D}]}_{\text{total}}=\underbrace{\mathbb{E}_{p(\theta\mid\mathcal{D})}H[y\mid x,\theta]}_{\text{aleatoric}}+\underbrace{I(y;\theta\mid x,\mathcal{D})}_{\text{epistemic}}

總預測熵分解為偶然(期望條件熵)加上知識(互資訊)。

又稱
epistemic uncertaintyaleatoric uncertainty知識不確定性偶然不確定性