在 SLO 下彈性擴展推論
生產流量並不平坦——它有每日高峰、週末低谷,以及偶發的爆紅尖峰。推論自動擴展(inference autoscaling)隨需求調整服務副本(replica)數量,好讓你滿足延遲 SLO(例如 p99 低於 200 毫秒),又不必在凌晨三點為閒置的加速器付費。核心張力是經濟性的:副本太少,請求排隊到超過 SLO;副本太多,你就把錢燒在閒置 GPU 上,而它們遠比一般網頁伺服器昂貴。
機器學習的自動擴展比網頁的更難,原因有二。其一,向上擴展很慢:把一個數 GB 的模型載入一張新 GPU 是一次數秒到數分鐘的冷啟動,所以你必須以領先訊號(佇列深度、請求率)擴展,並保留熱機餘裕,而非等延遲已被突破才反應。其二,正確的擴展單位是批次(batch):GPU 在許多請求一起處理時最有效率,因此自動擴展與批次策略緊密互動。
自动扩缩核心目标的精确表述:选择最少的副本数 N,在最小化推理成本的同时使 p99 延迟保持在 SLO 之内。
模型治理與稽核
隨著機器學習進入招募、信貸、醫療等受監管領域,「能用」已不足夠——你必須證明它如何運作、誰核可它,以及它持續在界線之內。模型治理與稽核(model governance and audit)是由核可流程、文件與不可變稽核軌跡構成的那一層,讓模型可被究責。它直接立基於第一篇的血緣骨幹:沒有可重現的版本就不可能治理,因為你無法稽核一個你無法重建的模型。
示意图:模型在两个人口群体间产生不平等的结果。
- 文件:每個版本一張模型卡(model card)——預期用途、訓練資料、已評估的公平性切片、已知限制。
- 核可流程:由具名的人在「測試中 → 生產」升級上把關簽核,並不可變地記錄。
- 稽核軌跡:誰在何時部署了什麼、以哪份資料訓練、為何如此——數月後仍可回答。
- 控制:存取限制、變更紀錄,以及監管者可檢視的、有文件記載的資料血緣。
在許多司法管轄區,這已不再是可選項:像歐盟人工智慧法案(EU AI Act)這類規範,對高風險系統課以文件、風險管理與人為監督的義務。能撐過稽核的團隊,是那些把治理當成良好版本管理與中繼資料副產品的團隊——而不是慌亂地去重建一段從未被記錄的歷史。
LLMOps:當工件是一段提示詞
維運一個大型語言模型(large language model)應用,打破了古典 MLOps 內建的數個假設。你往往沒有訓練那個模型——你呼叫它,可能還是第三方的。定義行為的工件常常不是權重,而是提示詞(prompt)、工具定義與檢索脈絡。輸出是開放式文字,因此「準確率」不再是單一數字,而單一使用者請求可能扇出成一條由模型呼叫、工具調用與檢索步驟組成的鏈。
LLMOps 可觀測性以追蹤(tracing)來迎接這點:捕捉一次請求的完整樹——送出的每段提示詞、回傳的每個 token、每次工具呼叫及其結果,以及每個節點的延遲與成本。一條追蹤是第四篇那份連接可觀測性紀錄在大型語言模型時代的對應物,而且不可或缺:當一個代理(agent)給出錯誤答案,臭蟲幾乎總是在鏈裡某處——一次糟糕的檢索、一個畸形的工具結果、一段漂移的提示詞——唯有追蹤能讓你看出是哪一步失敗。
評估也隨之轉變:在沒有單一黃金標籤的情況下,團隊越來越常用大型語言模型當評審(LLM-as-a-judge)——用一個強模型依量表為回應評分——並在生產中對抽樣追蹤持續執行。它強大卻會出錯(評審本身也有偏誤),所以把它的分數當成一個受監控、需以人工複核校準的訊號,絕不當成不容置疑的真相。
提示詞版本管理與新的上線迴圈
若提示詞是定義行為的工件,它就值得我們在第一篇給模型的一切。提示詞版本管理(prompt versioning)把提示詞當成一等公民的可部署工件:每段都被版本化、儲存、連結到它產生的評估結果,並經由同一座安全上線階梯釋出——你把新提示詞金絲雀到 5% 流量、以受評審的品質與成本相比,若退化就立刻回滾。一次提示詞編輯就是一次部署,並承載這個詞如今所帶的一切紀律。
研究前沿
生產級機器學習是一個年輕、快速演進的領域,其開放問題正是研究與你剛巡覽過的維運現實交會之處。幾個活躍的前沿:高效服務——隨著模型尺寸超越硬體,連續批次(continuous batching)與「預填/解碼分離」這類技術如何為每張加速器榨出更多吞吐量?生成式系統的漂移——當輸出是沒有標籤的自由文字時,「漂移」究竟意味著什麼?又如何在沒有真實標籤下偵測一個代理的品質退化?
以及代理維運——當一次使用者請求展開成數十個相互依賴的模型與工具呼叫,本軌道一路談的成本歸屬、可靠性、評估與回滾等問題,都必須為一個模型系統而非單一模型重新回答。本軌道的主線即使在前沿依然成立:一個模型唯有在你能重現它、謹慎上線、誠實監看、經濟地擴展並完整究責時,才在生產中可信。其餘皆是細節——重要、演進中,但仍是細節。現在,你手上有了這張地圖。
一张回路图,展示 LLM 智能体在推理、通过工具执行动作、观察结果之间循环。