推薦:為長線而最佳化
一條動態或一份播放清單是一連串決策,這讓它天生適合強化學習。強化學習用於推薦系統把目標從「預測下一次點擊」重新框定為「最大化長期使用者價值」——以週為單位的滿意度,而非一次點按的多巴胺。這個重新框定就是重點:貪婪的點擊最大化器會學成標題黨,而序列觀點則能珍視持續的投入與探索。
但你不能讓一個上線的強化學習代理人,在數百萬使用者身上自由實驗。因此推薦系統倚重離線強化學習(offline RL)——從紀錄下來的互動資料中學習、不做新的探索——再加上任何策略上線前審慎的 A/B 測試。這裡的環境是人,而人並不樂意成為一次訓練軌跡。
資源與晶片:規模化的序列最佳化
許多困難的工程問題,骨子裡其實是序列決策問題。強化學習用於資源管理處理叢集上的工作排程、網路流量繞送、運算資源配置與負載平衡——在這些領域中,一連串的放置選擇決定了吞吐量,而搜尋空間遠大到手調的啟發式規則無從應付。
一個醒目的例子是強化學習用於晶片設計:把處理器的元件擺放到矽晶片上(佈局規劃, floorplanning)是個龐大的組合難題,連線長度與時序取決於每一個選擇。把佈局視為一連串決策,讓強化學習代理人能在數小時、而非數週內產出可與人類專家匹敵的佈局——這與能源與控制是同一套範本,只是套用到矽晶片上。
蒙地卡羅樹搜尋展開並評估決策樹的各個分支。
獎勵工程:大師級的技藝
在本軌道的每一個應用中,有一個決定主宰著成敗:獎勵是什麼。獎勵工程實務是把模糊的人類目標,轉成代理人去最大化的純量的工藝——它令人謙卑,因為強化學習代理人會去最佳化你確切寫下的東西,而不是你心裡想的。
獎勵設計最終決定了智能體所要最大化的目標函數:期望折扣回報。
這正是獎勵入侵(reward hacking)發作之處:代理人找到漏洞,拿高分卻違背你的本意——一個賽船代理人原地打轉撿取加分球,而不去完成比賽。這是古德哈特定律(Goodhart's law)的直接體現:當一個量度變成目標,它就不再是個好量度。代理人越強,就越有創意地鑽一個有瑕疵的獎勵的空子。
- 從稀疏而誠實開始:先獎勵你真正在乎的結果(即使它很罕見),再考慮加入任何塑形。
- 謹慎加入塑形:密集的提示能加速學習,但每一個都是新的漏洞——確認它無法被單獨鑽空子。
- 盯著行為,而不只是數字:檢視代理人實際做了什麼;一條上升的獎勵曲線可能藏著獎勵入侵。
- 明確編碼約束:對不安全或不樂見的行為施加懲罰或硬性限制,在實體或面向使用者的系統中尤其如此。
- 讓人參與迴圈反覆修正:檢視失敗案例、精修獎勵、再次測試——獎勵設計很少一次到位。
把一切收攏
應用型強化學習是一條流程,而不是單一演算法。你挑選或打造一個環境、跨越現實鴻溝轉移,最後成敗繫於你的獎勵。遊戲那些華麗的基準勝利證明了什麼是可能的;動態推薦、資料中心與晶片裡那些低調的勝利則證明了什麼是有用的。精通之道,在於辨認哪些問題具備對的形狀——並抵抗那股「去獎勵容易的代理指標、而非真正目標」的誘惑。
MLOps 生命週期示意圖:資料、訓練、部署、監控、漂移偵測與重新訓練的回饋迴圈。