可解釋性

電路探索(circuit discovery)

一旦你接受「行為是由電路實現的」,下一個問題就是如何找到它們,而不必親手追蹤每一條線。電路探索自動化地搜尋那個對某項特定任務負責的最小子圖——由注意力頭、神經元與連線組成,例如辨識句中正確受詞所需的那些元件。產出是一張小小的接線圖,從一個有數十億連線的網路中切出來,卻仍能自行重現該行為。

標準做法是從完整的運算圖出發、再修剪。你透過替換激活值反覆地問:移除或改接某條邊,會不會傷害任務表現;無關緊要的邊就剪掉,留下因果骨架。像 ACDC、邊歸因替換、以及以稀疏自編碼器為基礎的電路追蹤等自動化方法,把這種修剪規模化,讓它能跑過許多元件,而不是靠研究者的直覺。

探索是進展,不是證明。找到的電路,好壞取決於你用來定義它的任務與指標、為某種提示分布找到的電路未必能類推,而修剪也可能漏掉那些會悄悄頂替被消融元件的「備援」元件。找到的子圖是關於機制的一個假設,仍需要忠實度檢查。

又称
automated circuit findingACDC