可解釋性
注意力頭解讀(attention head interpretation)
一個 transformer 層裡有許多平行運作的注意力頭,每一個都能自由地回看不同的較早詞元。解讀一個頭,就是搞清楚它的工作:它注意哪些詞元、為什麼,以及在注意時把什麼往前複製。有些頭結果做的是可辨認的事——注意前一個詞元、把代名詞指向它的先行詞、把一個字連到它的詞性、或是找出對應的括號。
描述一個頭需要兩種成分。注意力樣式說明它看哪裡:一個查詢—鍵的比較,替每個詞元決定要從哪些較早的位置取資訊。輸出—值的行為則說明它選定之後寫了什麼:一個值—輸出的變換,把某些資訊搬進殘差流。把兩者一起讀——通常要看很多例句、再用替換激活值來確認因果——你才能替一個頭指派功能,而不只是給出一張熱力圖。
要謹慎。乾淨的注意力樣式有提示性,卻不是證明——一個頭看哪裡,不等於它計算什麼,而且許多頭是多義的、或只有與其他頭搭配時才重要。誠實的注意力頭解讀,會把視覺樣式搭配因果介入,來檢查這個頭是否真的做了它的圖所暗示的事。
注意力權重本身不是解釋——見 attention-as-explanation,了解「頭看哪裡」為何可能誤導。
又稱
另見