建構大型語言模型應用與前沿

大型語言模型維運(LLMOps)

把一個 LLM 功能上線只是起點,不是終點。大型語言模型維運(LLMOps)是上線之後讓它在正式環境保持健康的一切:盯著模型對真實使用者究竟做了什麼、追蹤成本與延遲、抓出品質的退步,並安全地推出變更。它借用了運行普通軟體服務的紀律,再針對「一個機率性、難以測試的元件」的怪脾氣加以調整。

實務上,這意味著把每一則提示與回應都記錄下來(同時謹慎處理隱私)、用儀表板監看延遲、錯誤率、詞元花費,以及拒答或失敗的比率,並在其中任何一項漂移時發出警報。提示與模型版本都像程式碼一樣被追蹤,於是你能確切知道是什麼產出了某個輸出,並能回滾。新的提示或模型會逐步釋出——先給一小部分流量——並在全面推出前,拿現行版本在線上指標與離線評測集上做比較。

LLM 讓這件事比傳統軟體更難,因為它的輸入與輸出都是開放的、供應商會在你底下偷偷更新模型,而同一個提示隨時間也可能表現不同。沒有監控,你就是盲飛:品質會悄悄衰退、成本會突然飆升,而你只能從憤怒的使用者那裡才學到教訓。成熟的 LLMOps 把這些意外,變成你能在客戶察覺之前就採取行動的儀表板與警報。

又称
LLM operationsMLOps for LLMs