Transformer 引擎

注意力模式視覺化(attention pattern visualization)

因為注意力權重不過是介於零和一之間的數字,我們可以把它畫出來。常見的圖是熱力圖,或一張把每個詞元連到它所注意詞元的線網,權重愈強,連結就愈亮或愈粗。對一個真實句子去看這些圖,你常常能看到某個頭總是指向前一個詞,或某個頭把每個代名詞連到它指涉的名詞。

這些視覺化是窺看模型內部運作的第一扇窗。挑一層、挑一個頭,把它那張 n 乘 n 的權重格子畫出來,研究者就能發現反覆出現的圖樣——局部頭的對角條紋、大家都注意的詞元形成的垂直帶、成對括號之間整齊的弧線。能互動式呈現這些模式的工具,曾幫助揭露歸納頭與其他可重用的電路。

但一張漂亮的圖樣不是解釋。對某個詞元注意得多,並不證明那個詞元造成了輸出,因為被搬運的值與較後的層都有影響,而 softmax 又逼著一些權重非落在某處不可。注意力圖是寶貴的線索、卻是薄弱的證明;嚴謹的可解釋性,會把它們和真正改變運算的介入手法配在一起。

又称
attention maps