大型語言模型工程

前綴微調(prefix tuning)

提示是靠在輸入前面放文字來引導一個凍結的模型;前綴微調做的是同一件事,但用的是模型自己絕不會寫出、且被直接最佳化的向量。它不只在輸入端前置詞元,而是在每一層注意力的鍵與值前面,前置一小段可訓練的連續向量。凍結的 transformer 於是會對這段學來的脈絡施加注意力,彷彿它是更早的詞元,而梯度下降會雕塑這些向量以誘發你想要的行為。

由於前綴存在於每一層的鍵值快取裡,它一路向上影響整個堆疊的計算,而不只在嵌入層——這正是它與「只在輸入端」的軟提示之分野,也給了它更大的槓桿。只訓練前綴(常透過一個小 MLP 重新參數化以穩定最佳化,之後再丟棄)讓所有原始權重維持凍結,因此每個任務的代價只是幾千個向量。推論時,前綴就只是被串接進 KV 快取裡。

當你需要在一個共享骨幹上做出許多輕量任務特化、且希望它們深入作用而非僅停留在提示層時,前綴微調最出色。它的弱點是相對於 LoRA 或完整微調的表達力、對前綴長度的敏感,以及要推敲那些不透明連續向量到底編碼了什麼的尷尬。

前綴微調會吃掉每一層有效脈絡預算的一部分——前綴越長,模型能注意到的真實輸入就越短。

又称
prefix tuning前綴微調