檢索增強生成

RAG 評估(RAG evaluation)

一套 RAG 系統可能在兩個截然不同的地方出錯。它可能檢索到錯的段落,這時連完美的模型都註定失敗;或者它檢索到完全正確的段落,卻仍然答得很糟。正因如此,你必須分別衡量這兩半——而不是只瞄一眼最終答案碰巧看起來好不好。

檢索用召回率、k 個結果內的準確率之類的排序指標來評分:握有答案的那段,到底有沒有進到候選名單裡?生成則就忠實度評分——答案裡每一句主張,是否真的能從檢索到的脈絡推得出來?——以及答案相關性,也就是它有沒有回答到被問的問題。忠實度常由另一個擔任評分員的 LLM 來判定。把這些拆開的理由很實際:糟糕的檢索與糟糕的生成,需要的修法完全不同。