機器學習維運與生產

特徵管線編排(feature pipeline orchestration)

特徵很少來自單一查詢。一個有用的特徵,例如某顧客的七日滾動消費額,仰賴原始交易被攝取、去重、連接、彙總並具現化,而這些步驟每一步都依賴前一步。特徵管線編排就是把這團相互依賴的糾結,轉化為可靠且可重複排程的那一層:它知道哪些任務必須先於哪些執行、新資料何時抵達,以及當某一步在中途失敗時該怎麼辦。

編排器把工作建模成一張任務的有向無環圖,附帶明確的資料依賴,再依觸發條件排程,這些條件可能是時間式、事件式或感測式(當上游資料表更新時才執行)。良好的編排提供冪等且可重試的任務、用於重新處理歷史視窗的回填(backfill)、作為閘門步驟的資料新鮮度與品質檢查,以及記錄哪一次執行產生哪些特徵值的血緣。其輸出餵入特徵儲存庫,讓訓練與服務都讀到一致計算出的特徵。

微妙的失效模式是部分具現化。若服務端讀到的特徵其管線尚未完成最新視窗的計算,它會無聲地消費到過時或空值,而這正是訓練與服務偏差最常見的根源之一。會以新鮮度訊號作為服務閘門、而非只是期望排程跟得上的編排,正是把展示原型與生產系統區分開來的關鍵。

又稱
feature orchestration特徵管線排程