可解釋性

激活引導(activation steering)

一旦你找到了代表某個概念的內部方向——模型對應「誠實」、「憤怒」或「談論婚禮」的那個特徵——一個誘人的問題隨之而來:如果在模型運行的當下,直接把那個旋鈕調大或調小,會怎樣?激活引導做的正是這件事。你不去改提示、也不去重新訓練,而是在模型運算的過程中伸手進去,把一個選定的方向加到它的激活上,即時推動它的行為。

具體來說,你先取得該特質的引導向量,常見做法是取「具有該特質的例子」與「缺乏該特質的例子」的平均激活之差(例如,親切的回覆減去無禮的回覆)。然後,在生成過程中的某一層,把那個向量的某個倍數加到運行中的激活上。把「拒絕」方向調大,模型就更常拒絕;把它調小,它就更常照辦;加上一個「金門大橋」向量,模型就會在沒被問到時開始提到那座橋。推動的幅度與所在的層,都是你可以調的旋鈕。

這對安全有兩重意義。作為研究探針,引導是「某方向確實承載某概念」的有力因果證據:如果加上它能可靠地、以預測的方式改變行為,那麼這個特徵就是在做真正的工作,而不只是相關。作為控制方法,它暗示了一條輕量途徑,能在不必昂貴重新訓練的情況下讓模型更安全(把它引導離開欺騙或毒性)。但誠實的提醒不小:引導很粗糙,常會損害流暢度或對無關能力產生副作用,可能被撤銷或覆蓋,而且只對我們叫得出名字的行為有效——它是一支有前景的槓桿,而不是控制的保證。

把引導向量建構為「在充滿愛意文字上的激活」減去「在充滿仇恨文字上的激活」。在生成時加上它,模型的回覆會明顯變得溫暖;把它減掉,回覆就變得冷淡——相同的提示、相反的語氣,且不需重新訓練。

激活引導在運行時加上一個概念方向以推動行為——同時也證明該方向具有因果作用。

引導是一種粗糙的控制:它可能損害流暢度、產生副作用,也可能被覆蓋。一次成功的引導是某特徵具因果作用的良好證據,但本身並不是可靠的安全保證。

又称
steering vectorsactivation addition激活引導引導向量