可解釋性

對數透鏡(the logit lens)

/ LOH-jit lenz /

語言模型分許多層來構建它的答案,就像一個念頭在被說出口之前,要先經過心智的許多階段。平常你只看得到它最後輸出的那個詞。對數透鏡是一個聰明的把戲,讓你能偷看每一個中間階段那個尚未成形的念頭:它在每一層問「如果模型現在就必須決定下一個詞,它會說什麼?」——把模型變成一本翻頁動畫書,讓你看著預測逐漸成形。

它之所以行得通,是因為 Transformer 一層一層地不斷精煉同一份「運行中的表示」,而模型本身已經擁有一道固定程序(稱為解嵌入,unembedding),把一份表示轉換成對各個詞的猜測,並以稱為 logits 的數值來評分。對數透鏡只是把這道最後一步的程序提早套用——套到第 5 層、第 10 層等等的隱藏狀態上,而不是只在最後才套用。通常你會看到模型的猜測一開始模糊、然後變得銳利:往內幾層它可能已經傾向某個主題,要到較後面的層,確切的答案詞才勝出。

對數透鏡受人喜愛,是因為它幾乎免費——不需訓練,只要重複使用模型自己的輸出映射——而且它給出一個關於預測如何形成的直覺故事。但它誠實的限制是真實而有教育意義的。早期的層本來就不是設計來被最終的解嵌入讀取的,因此這面透鏡可能給出亂碼或誤導的讀數,在某些模型或某些層尤其如此;後來發明的改良方法,部分正是為了修正這一點。把它當作對運算的快速、提示性的速寫,而不是忠實的逐字稿——它生動地說明了一個簡單的可解釋性方法若被過度信任,會如何誤導人。

輸入「The Eiffel Tower is in the city of ___」。逐層套用對數透鏡,你可能會看到模型的首選猜測從泛泛的詞,飄到「France」,最後在最後幾層鎖定「Paris」——一本「答案如何被決定」的翻頁動畫。

對數透鏡在中間層重複使用模型的輸出映射,藉以觀看一個預測的成形過程。

中間層並非被訓練來直接解碼的,因此對數透鏡的讀數可能失真或出錯;把它們當作線索,並用更穩固的方法加以佐證。

又称
logit lens對數透鏡logit 透鏡