建構大型語言模型應用與前沿
大型語言模型產品評估(LLM product evaluation)
一個模型可以在學術基準上拿滿分,卻仍做出一個使用者不喜歡的產品。產品評估(product evaluation)問的是真正要緊的問題:這個功能從頭到尾,有沒有為使用它的人帶來真實的價值?它越過模型孤立的分數,去看整個系統——提示、檢索、防護欄、介面——有沒有幫助使用者達成他的目標。
產品評估糅合了離線與線上的訊號。離線方面,針對任務的評測集在具代表性的輸入上量測端到端的品質,而非通用的基準分數。線上方面,你觀察真實的行為:使用者接受了答案、改寫它、重試,還是放棄了任務;按讚率、轉換率、任務完成率,以及升級給真人的比率。A/B 測試在這些商業指標上比較不同版本,而抽樣的真人審查則閱讀真實對話,找出沒有任何指標能捕捉的問題。誠實的衡量是下游的結果,而非模型孤立的聰明。
孤立地優化模型,可能悄悄傷害產品——一個更囉嗦的模型也許在基準上分數更高,卻惹惱了使用者;一個更有自信的模型也許討好了評分者,卻誤導了他們。把評估綁在真正的使用者價值上,能讓團隊對自己在打造的東西保持誠實。這比跑一個基準更難,因為真實價值雜亂又難以快速量測,但它是最終決定產品成敗的唯一分數。
另见