大型語言模型工程

檢索增強微調(RAFT,retrieval-augmented fine-tuning)

被放進檢索流程裡使用的模型,在推論時會被遞上文件,但如果它從未被訓練去適應這種情境,它往往不是忽略證據、就是被無關段落帶偏。檢索增強微調,是為了模型真正會面對的這場「開書考」而訓練它:每個訓練範例都把一個問題與檢索到的段落並陳,刻意把真正相關的文件與看似合理的干擾項混在一起,讓模型學會靠對的那些來作答。

讓它生效的是那個教學訊號。目標被寫成思維鏈式的答案,逐字引用並標註支持它的段落,於是模型因「把每個主張接地」而獲獎勵,而非背誦參數記憶。有一部分範例只放干擾項,逼模型學會「檢索到的脈絡其實不含答案」是什麼情況。效果是一個會批判性閱讀脈絡的模型:它引用有用的、折抵無用的,而這正是上線檢索系統所需的本領。

相較於把現成模型直接套上樸素的檢索增強生成,RAFT 對不完美檢索的穩健度明顯更好,在目標領域的接地也更強。代價是要建構帶有寫實干擾項配比的監督資料,而這樣調出來的模型,會特化於它所對抗訓練的那種檢索風格。

只含干擾項的範例比例是一個真正的旋鈕:太低,模型會盲目信任檢索;太高,它會學成連好脈絡都不信。

又稱
RAFT檢索增強微調