評估、穩健性與倫理

模型可解釋性

模型可解釋性是讓視覺模型的決策對人類可理解的努力——回答「它為何做出那個預測?」,而不是被動接受一個不透明的判決。深度網路是黑箱:數億個權重透過無人能直接跟上的運算,把像素轉成標籤。可解釋性方法把箱子打開到足以檢查:模型是否「因正確的理由而正確」、用以除錯失敗、建立有依據的信任、滿足問責與法規要求,並發現模型何時偷偷利用了虛假線索而非真實物件。

視覺中最常見的工具是顯著性與歸因方法,它們在輸入上產生一張熱圖,顯示哪些像素對決策影響最大。基於梯度的方法(原始梯度、整合梯度 Integrated Gradients、SmoothGrad)問的是「每個像素改變時輸出如何改變」;Grad-CAM 利用流入最後一層卷積層的梯度,標出 CNN 所聚焦的影像區域;擾動方法(遮擋、LIME、SHAP)則遮蓋或變動影像的一部分,觀察預測如何移動,把重要性歸因給最關鍵的部分。這些產生直覺的「它看了哪裡」地圖,但屬於局部解釋——它們解釋的是單一預測,而非模型的全域邏輯。

第二個更深的家族問的是模型學到了什麼概念,而不只是哪些像素重要。基於概念的方法(TCAV——以概念激活向量測試)量化「條紋」或「車輪」之類人類有意義的概念,對某類別預測的驅動程度有多大;特徵視覺化合成出能最大激發某選定神經元的輸入,揭露它偵測的是什麼;而機制可解釋性(mechanistic interpretability)與探測(probing)則剖析內部表徵,繪出網路所學的特徵與電路。這些瞄準的是對模型的全域、結構性理解,補足逐影像的顯著性觀點,並已成為理解 CLIP 與視覺 Transformer(其注意力圖提供了一扇局部、有時會誤導的窗)等大型模型的核心。

這個領域最艱難的教訓是:一個解釋可以看起來很有說服力,卻不忠實——它可能並未反映模型實際的運算。某些顯著性方法已被證明即使在模型權重被隨機化後仍產生幾乎相同的熱圖,意味著它們解釋的是影像、而非模型;歸因可能不穩定(微小的輸入變化就讓地圖大幅擺動),甚至可被對抗式操弄。因此可解釋性必須接受它自己的評估標準:忠實性(解釋是否追蹤模型真正的推理?)、穩健性、與對人類的有用性——而一張看似合理的熱圖,本身永遠不能作為「該解釋正確」的證據。可解釋性最重要之處,恰恰是在高風險視覺(醫學診斷、自動駕駛、鑑識辨識)中——一個恰好分數很高、卻「因錯誤理由而正確」的模型,是一顆等著浮現的未爆彈。

一張漂亮的顯著性地圖不是證明。信任解釋之前先做健全性檢查:若把模型權重隨機化後熱圖幾乎不變(Adebayo 等人的健全性檢查),該方法解釋的是影像、而非模型。重要的判準是忠實性,而非視覺上的合理性。

又称
explainabilityXAIsaliencyattributionexplainable AI