可解釋性
激活值操控(activation steering)
激活值操控在推論時輕推模型的內部狀態,藉此改變它的行為,完全不必微調。你在激活空間中找到一個對應某個屬性的方向——誠實、拒答、愉快的語氣、某個主題——再趁模型運行時把那個向量加進殘差流。模型就會朝你選的方向傾去,像推帆讓船傾斜那樣,而其他一切照常進行。
這個方向通常是用對比建出來的。讓模型在「只差在目標屬性」的成對輸入上各跑一次——例如配對好的誠實與欺騙的續寫——再取它們激活值的差,得到一個操控向量。把它加上去會放大該屬性,減掉則會壓抑它。這直接連到表徵工程,也連到稀疏自編碼器特徵操控(後者的方向來自學到的字典,而非成對提示)。
操控之所以吸引人,是因為它便宜、可逆、又可解釋——它把行為當成你能加上、也能拿掉的方向。但它很鈍:單一向量很少能分離出一個乾淨的概念、推太用力會破壞流暢度,而同一個能助長有益特質的把手,也可能助長有害的特質,所以它同時是安全工具,也是安全風險。
又称
另见