應用、環境與模擬到真實
強化學習用於資源管理(RL for resource management)
許多系統時時刻刻都在決定如何分配有限的資源——哪個工作跑在哪台伺服器、封包怎麼繞送、何時快取或淘汰資料。每個選擇都對後續選擇帶來延遲的後果,這使資源管理天生就是一個序列決策問題,也很適合 RL。
狀態描述當前的負載與待處理的需求;動作進行指派或排程;獎勵反映吞吐量、延遲、成本或公平性。RL 能找出一套針對「實際工作負載分布」調校的策略,而不必倚賴手寫的啟發法。例子包括叢集工作排程、網路繞送、壅塞控制與資料庫查詢最佳化。
正式系統要求可預測性,所以學到的策略在部署前通常需要護欄、備援啟發法,以及審慎的離線評估。一個「平均略好、但偶爾災難」的策略,幾乎總是會被否決。
又称
另见