可解釋性
殘差流分析(residual stream analysis)
在 transformer 中,每一層都會讀取、也寫入每個詞元共用的一個向量,稱為殘差流(residual stream)。可以把它想成一條貫穿模型的輸送帶:注意力頭與前饋區塊各自把自己的貢獻「加」到帶子上,而不是把原本的東西換掉。殘差流分析把這條帶子當作模型主要的資訊匯流排,研究每個元件放了什麼上去、後面的元件又拿走了什麼。
因為這些相加是線性累積的,你可以在任一處把殘差流分解成所有較早的注意力頭與層之貢獻的總和。這讓我們能問出精確的問題:是哪個頭寫入了最終反嵌入用來預測這個字的那個方向?像對數透鏡、直接對數歸因、替換激活值這些工具,全都靠這種「可加」結構,把輸出歸因回造成它的那些具體寫入者。
這個視角把 transformer 重新理解成許多小元件,透過讀寫方向在一條共用通道上彼此溝通。它釐清了很多事,但也部分是理想化:層正規化會對殘差流做非線性的重新縮放,而疊加意味著單一方向可能承載好幾條重疊的訊息,所以歸因得小心。
又称
另见