大型語言模型工程
上下文視窗擴展(context window extension)
一個被預訓練來處理譬如四千個詞元的模型,並不能優雅地讀四萬個:餵給它訓練時從未見過的位置,它的旋轉位置編碼就落到分佈之外,注意力退化,品質跌落懸崖。上下文視窗擴展是一組技術,把預訓練模型的可用脈絡推到遠超原始上限,卻只付一點額外微調的代價,而非從零重新訓練。
多數現代方法動的是位置編碼、而非權重。位置內插把位置索引重新縮放,使長序列落回模型受訓過的範圍內,以角解析度換取觸及距離。NTK-aware 縮放與 YaRN 則更精細地、非均勻地調整旋轉基頻——拉伸承載長程資訊的低頻、放過編碼局部順序的高頻——而一段短暫的、在長序列上的續訓,讓模型安頓進新的幾何。成果是在數倍於預訓練長度的脈絡上仍連貫的注意力。
擴展讓長文件推理與大型檢索脈絡成為可能,但它並非免費。隨著長度增長,注意力與 KV 快取的成本仍大致從線性到平方地增加,於是記憶體與延遲攀升;而一個技術上能在長脈絡上施加注意力的模型,仍可能拙於使用它的中段——「迷失在中間」效應——所以更大的視窗對真正的長程推理是必要、卻不充分的。
更大的上下文視窗衡量的是容量、不是本領:像「大海撈針」這類基準測的是跨長度的檢索,但模型可以通過它,卻仍在長輸入上推理不佳。
又稱
另見