可解釋性
對數透鏡(logit lens)
對數透鏡是個廉價的小技巧,讓你在運算進行到一半時偷看模型的「心思」。一般情況下,只有最後一層的隱藏向量會乘上反嵌入矩陣來產生下一個詞元的預測。對數透鏡把同一個最終投影,也套用到每一個較早層的隱藏向量上,彷彿模型必須當下就回答般把每層解碼出來。於是你得到一條逐層的軌跡,看模型一邊思考時偏向什麼。
這揭露的是一個預測逐步變銳利的過程。在較早的層,解碼出的分布往往含糊或籠統;到了中間層,常常會冒出一個有自信的猜測,之後就只是被微調。這是一個快速辦法,能大致定位一項事實或決定在堆疊的哪裡被敲定,並看著一個錯誤的早期猜測被修正——或一個正確的猜測漂走。
它是一面「透鏡」,帶著這個名字所承認的扭曲。較早的層並不是被訓練來讓最終反嵌入讀取的,所以它們解碼出的對數機率可能誤導,尤其在正規化之前。調校透鏡(tuned lens)透過學習一個小型的逐層轉接器修正了部分問題;無論如何,請把對數透鏡的讀數當作有用的草圖,而非絕對真相。
又称
另见