微調與適配
全參數微調 vs. PEFT 微調
當你要適配一個模型,會碰到一個岔路:更新每一個權重(全參數微調),還是只更新一小片高效的部分(PEFT)。全參數微調是重量級的選項——最大的彈性、最大的成本;PEFT 是靈巧的選項——以零頭的代價拿到大部分的好處。
全參數微調需要的記憶體要裝下所有參數,再加上它們的梯度與優化器狀態——往往是模型本身大小的好幾倍——而且每個任務產出一個完整大小的檢查點。PEFT 把基礎凍結、只訓練不到百分之一的權重,於是記憶體與儲存大幅崩降,任務也變成可替換的適配器。對大多數適配工作而言,品質差距很小;但當你必須大幅移動模型時——深層的領域轉移、新的語言,或行為上的大改變——全參數微調仍然勝出。
實用的拇指法則:先從 PEFT 開始,只有當量測結果顯示那份增益值得額外成本時,才升級到全參數微調。
另見