微調與適配

合成指令資料(synthetic instruction data)

手寫指令範例既慢又貴,所以一個如今很標準的捷徑,是讓一個有本事的模型替另一個較小或較新的模型寫訓練資料。你提示一個強大的 LLM 去產生指令與答案,再用它的產出來做微調。

像 Self-Instruct 這類流程會先放進少數人寫的範例,請模型腦力激盪出更多指令、生成回應,再依品質與多樣性篩選結果。合成資料便宜、可規模化,也容易針對覆蓋上的缺口去補。但風險是真實存在的:學生會繼承老師的錯誤與偏誤、誤差可能滾雪球,而把模型過度地拿自己這類產出來訓練,反而會讓它退化。篩選,再混入一些真實資料,是常見的防護欄。