可解釋性

特徵與電路(features and circuits)

這是機制可解釋性的核心詞彙。特徵(feature)是模型學會表示的某個概念——它在激活空間中的一個方向,例如一遇到「首都」這個概念、Python 的函式引數、或諷刺的語氣就會亮起來。電路(circuit)則是接線:一組特徵,加上負責讀取某些特徵、寫出另一些特徵的元件,組成一個把輸入變成中間概念、再變成輸出的小型運算。

可以把它類比成邏輯電路圖。特徵是線上有意義的訊號;電路則是轉換這些訊號的閘與連線。著名的例子是歸納電路:一個注意力頭找出目前的詞元先前出現在哪裡,第二個頭再複製它後面接的東西——兩個特徵加一條連線,合起來實現「複製這個樣式」的規則。這套框架的賭注在於:複雜行為能拆解成許多這類可重複使用的零件。

這套框架很有力,卻會漏。特徵不一定是清晰、單一含義的方向——許多特徵因疊加而糾纏,同一個神經元也可能參與好幾條電路。所以白板上畫得乾乾淨淨的電路,通常是權重內部某個更糾結之物的理想化版本,要驗證它得靠因果測試,而非只是一張看似合理的圖。

又称
circuits framework