微調與適配
微調 LLM(fine-tuning)
預訓練好的 LLM 已經讀過網路上極大量的文字,對語言有廣泛的掌握,但它是個通才。微調就是那門簡短的後續課程,把這個通才往你真正想要的方向推一把——某個特定任務、語氣、輸出格式,或某個領域的知識。你保留模型已經學到的幾乎一切,只用一份小得多、聚焦的資料集溫和地調整它。
就機制而言,你是用梯度下降繼續訓練同一個網路,只是改用你精心整理的範例,而非原始的網路文字。每個範例算出一個損失,梯度往回傳,權重就微微移動。因為模型起點已經很強,通常只需要數千筆範例和一個很小的學習率,而不需要預訓練那種數兆詞元的規模。結果是一個為你的用途量身打造的新檢查點。
微調不是適配模型的唯一辦法——提示(prompting)和檢索往往完全不必訓練就能達成,而且迭代起來便宜得多。當你需要穩定一致的行為、固定的輸出格式,或提示無法可靠維持的某種風格時,才把微調拿出來用。
又稱
另見