人工智慧安全與對齊

表徵工程(representation engineering, RepE)

表徵工程是一種由上而下的可解釋性與控制取徑,它把高層概念——誠實、無害、奪權傾向、情緒——當成主要的分析單位,而非從個別神經元或電路出發。其立場是:複雜行為被編碼在分布式的群體活動之中,所以有成效的做法是去定位表徵空間中追蹤某概念的方向,再把它當監視器讀取、或當控制器寫入。

讀取靠的是「表徵讀取」:用成對刺激誘發概念、蒐集激活,再以線性或降維方法萃取出一個概念方向,或一個能偵測概念何時啟動的探測器。控制靠的是「表徵控制」:沿該方向擾動激活,或用一個定義在表徵空間裡的損失去微調,以放大或抑制該概念。激活引導就是這把大傘下一個具體的控制實例。

表徵工程之所以吸引人,是因為它運作在人類在意的層級,並能從同一個方向同時給出透明度(一個讀取殘差流的說謊或諂媚偵測器)與引導(抑制某有害概念)。它與由下而上的機制式可解釋性形成刻意的對照;代價是嚴謹度,因為一個線性概念方向可能只是近似、會糾纏相關概念,而「一個能預測概念的表徵」若未經介入檢驗,並不證明模型在因果上用了它。

又称
RepE表徵工程