應用、環境與模擬到真實

強化學習用於能源與控制(RL for energy and control)

大型實體系統——資料中心散熱、建築物的暖通空調、電網、化工廠——都是持續運轉的,一旦用靜態規則控制就會浪費能源。RL 能學出一個會因應天氣、負載與設備而調整的控制器,在尊重安全限制的前提下降低能耗。

狀態是感測器讀數,例如溫度、流量與電價;動作調整設定點、閥門或調度;獎勵是省下的能源或成本,並對任何違反限制的情形施加懲罰。由於在運行中的基礎設施上探索風險很高,這類系統通常從歷史記錄(離線 RL)或一個經校準的模擬器來學習,再以「學到的策略給操作員建議」或「被安全控制器框住」的方式部署。

安全與穩定壓倒一切。一個能省下百分之五能源、卻偶爾會讓硬體過熱的無約束控制器,是毫無價值的,所以明確的約束、保守的探索與人類監督是必備而非可選。

又稱
RL for HVAClearned industrial control