可解釋性

字典學習(dictionary learning)

想想幾十種樂高積木如何能拼出幾乎任何東西:每一個模型,無論多複雜,都只是把一小撮積木稀疏地挑出來拼在一起。字典學習就是這樣一個通用想法:去發現這樣一組基本構件——也就是字典——使得你資料中每一個複雜的例子,都能寫成其中少數幾個構件的小型組合。它在訊號處理中是一項古老的技術,在這裡被重新用來尋找模型「思緒」的構件。

嚴格地說,你有許多激活向量,你想學出一本由基底方向(稱為原子)組成的字典,使得每個激活都能用少數幾個原子相加來很好地近似。兩股力量在拉扯:重建必須準確,而選擇必須稀疏(每個例子只用少數原子)。稀疏性是關鍵成分——它迫使原子變成有意義、可重複使用的概念,而不是一團模糊,因為要用「少數原子的配方」重建出成千上萬個例子,唯一的辦法就是原子本身捕捉到真實、反覆出現的結構。稀疏自編碼器是當今在神經網路上實際進行字典學習最流行的方式。

對可解釋性與安全而言,字典學習是對疊加的正式回應:如果模型藉由讓特徵彼此重疊,把許多特徵塞進少數神經元,那麼字典學習就是有原則地嘗試把那些原始特徵還原成字典的原子。誠實的提醒是:原子的正確數量與正確的稀疏程度都是選擇,而非事實,而還原出來的字典是這套方法對模型概念的最佳猜測——一個有用、可檢驗的重建,而不是與模型真正使用的東西保證相符。

給定數千個混濁的激活向量,字典學習可能會發現一本字典,其中一個原子代表「過去式」、另一個代表「一個問句」、再一個代表「醫療情境」。於是任一個激活就被解釋成,比方說,「問句」加「醫療情境」被點亮——一份簡短、可讀的配方。

字典學習尋找可重複使用的構件概念;正是稀疏性讓它們變得有意義。

字典學習是目標(找出模型的特徵字母表);稀疏自編碼器是達成它的一種方法。所選的字典大小與稀疏程度,會強烈影響你「找到」什麼。

又称
sparse dictionary learning字典學習稀疏編碼