生成式AI與大型語言模型
微調(fine-tuning)
/ FYNE-too-ning /
微調,是拿一個本已通曉諸多通識的模型,給它上一門聚焦、規模小得多的訓練課,讓它在某一件特定的事上變得拿手。想像一位博覽群書的畢業生,幾乎什麼題目都能寫;微調,就是那幾週讓她變成一名稱職律師助理的在職培訓。廣博的底子早已在那兒,你只是把它往一條更窄的溝槽裡輕輕一推。
技術上,你從一個預訓練好的模型出發,在一份精心整理的資料集上繼續訓練它——比方說幾千條醫學問答的範例。模型內部的那些數字(它的權重)會微微挪動,去貼合新的例子。因為它在預訓練階段已經學會了語言,所需的資料和算力,遠比從零開始要少得多。像LoRA這樣的變體,只調整模型的一小片而非全部,讓這件事變得更便宜。
兩點要誠實說明。其一,微調可能引發「災難性遺忘」:在新任務上用力過猛,模型會丟掉一部分原有的通用本領。其二,微調注入「文風與模式」遠比注入「新事實」可靠得多——若你想讓模型用上特定的、最新的知識,檢索增強生成(在提問時把文件餵給它)往往比試圖把事實硬烤進權重裡要穩妥。
一家銀行從一個通用語言模型出發,在5000段過往的客服對話上對它做微調。之後,它便能用這家銀行的口吻作答、記得產品名稱、遵守內部規程——而無須有誰把模型從零重訓一遍,那要貴上千倍。
一門小而聚焦的課,把通才變成專才。
一個常見的錯誤,是在其實需要「檢索」時卻去做「微調」。如果問題是「模型不知道我們最新的價格」,那麼在提問時把價目表餵給它,通常勝過微調;微調真正擅長的是改變模型的「行事方式」,而非儲存那些不斷變動的事實。
又稱
另見