Transformer 與大型語言模型內部機制
ALiBi 線性偏置注意力(attention with linear biases)
ALiBi 完全移除位置嵌入,改用兩個 token 相距多遠來偏置注意力分數。在 softmax 之前,它扣掉一個與查詢和鍵之間距離成正比的懲罰:token 越往前,分數被打的折越多。完全沒有可學的位置向量——位置純粹存在於這個距離懲罰中。
具體上,對位置 i 的查詢與位置 j 的鍵且 j 不大於 i,ALiBi 在 softmax 前的分數上加 負 m 乘 (i 減 j),其中 m 是固定且依頭而異的斜率。每個頭取自一個幾何數列的不同斜率,因此有些頭以陡斜率注意得很局部,有些以緩斜率幾乎全域。由於偏置只是距離的簡單線性函數、不綁定任何訓練範圍,在長度 1024 訓練的模型可在長得多的長度上評估而幾乎不退化。
ALiBi 的招牌特性是長度外推:短訓長測。其弱點是單調的近因懲罰內建了強烈的局部性先驗,可能傷害需要精準長程檢索的任務;搭配頻率重縮放的 RoPE(如 YaRN)大致已成為更受歡迎的長上下文路線,但 ALiBi 仍具影響力,出現在 BLOOM、MPT 等模型中。
\mathrm{score}_{ij} = \frac{q_i^\top k_j}{\sqrt{d_h}} - m\,(i-j)
每個頭固定的斜率 m 對遠處 token 線性懲罰,取代了可學的位置。
又称
另见