人工智慧安全與對齊

激活引導(activation steering)

激活引導在推論時透過把一個固定的方向向量加進模型的隱藏激活,來操控其行為,完全不需更新權重。可以想像在模型生成到一半時,把它的內部狀態朝「誠實」推一小步,或推離「拒答」。由於這個介入發生在殘差流而非提示之中,它能撼動提示難以觸及的傾向,而且可以連續地調強或調弱。

引導向量通常以對比方式建構:在一對只沿著某概念不同的提示上跑模型——比方說誠實對欺騙的補全——取它們在某選定層上平均激活的差;這個差就指向該概念軸。推論時,你把這個向量按比例縮放後加進該層的殘差流,使下游的線性讀取偏向所要的概念。向量也可以來自稀疏自編碼器特徵,或直接最佳化得到。

它便宜、可逆、可組合,因而對安全修補與探測「哪些概念被線性表徵」都很有吸引力。其限制是引導是把鈍器:係數太大會損害流暢度;在某分布上找到的向量在另一分布上可能失效甚至反效果;而單一方向也鮮少能乾淨地捕捉一個概念。因此它最好被當成一個「關於表徵、可操控的假設」,而非一道穩健的護欄。

\mathbf{h}_\ell \leftarrow \mathbf{h}_\ell + \alpha\,\mathbf{v},\qquad \mathbf{v}=\overline{\mathbf{h}_\ell^{+}}-\overline{\mathbf{h}_\ell^{-}}

在第 L 層,殘差被加上縮放後的引導向量 v,此處為正、負概念提示之間的平均激活差。

又稱
activation addition激活引導activation editing