可解釋性
稀疏自編碼器特徵操控(SAE feature steering)
一旦稀疏自編碼器把某一層解碼成一個個命名的特徵,你能做的就不只是讀它們——你還能把它們調大或調小,看著模型隨之改變。操控(steering)指的是在生成過程中對單一個 SAE 特徵下手:把代表金門大橋的那個特徵硬鎖在很高的值,模型就會把那座橋塞進它寫的任何東西裡。它就像是針對模型自己學到的某個概念的音量旋鈕。
具體做法是把該特徵的解碼器方向,以放大的係數加回殘差流,再讓前向傳遞繼續。因為這個方向是稀疏自編碼器找出來的、而非人手猜的,操控同時也成了對特徵含義的因果測試:如果放大它正好產生它的標籤所預測的行為,就是強而有力的證據,顯示這個特徵真的代表那個概念,且模型在下游確實用到它。
操控既是研究探針,也讓我們瞥見不必重訓就能做到的細緻控制。它的限制很重要:把特徵推得太用力會破壞連貫性、特徵彼此會交互影響,所以一個旋鈕可能牽動其他特徵,而且特徵目錄並不完整,你只能操控字典剛好分離出來的那些。
又称
另见