建構大型語言模型應用與前沿
評測驅動開發(evaluation-driven development)
當你無法用肉眼判斷一個改動有沒有幫助時,就去量測。評測驅動開發(evaluation-driven development)的意思,是把你的 LLM 功能圍繞著一套不斷增長的測試案例來打造——成對的範例輸入,搭配一種為輸出評分的方法——於是每一次提示微調、模型更換或流水線變動,都用數字而非感覺來裁決。它是測試驅動開發的 LLM 版,針對「沒有唯一正解的輸出」加以調整。
你會湊出一份具代表性又刁鑽的輸入資料集,再定義如何替回應打分:對結構化欄位做精確檢查、用參考答案做比對的指標、標記禁止內容的規則,或讓一個 LLM 當評審,照著評分量表替答案打分。真實的使用者互動與過往的失敗,會隨時間回饋進這份集合。任何改動上線前,你都跑完整套並比較分數;在正式環境裡,你抽樣線上流量並持續評分,以抓出離線集合漏掉的退步。
沒有評測,LLM 開發就墮落成「改個提示、試三個範例、憑直覺上線」——品質正是這樣悄悄腐爛的。這份紀律並非免費:好的評測集要花力氣建立,而評審本身也不完美,尤其是會偏頗或被鑽漏洞的 LLM 評審。但一個能量測自身品質的團隊,能有意識地改進它;一個不能的團隊,則只是在猜。
又称
另见