前沿與開放問題
因果強化學習(causal reinforcement learning)
一般的 RL 從它恰好蒐集到的資料中學相關性:做這個,那個往往會跟著發生。因果強化學習(causal reinforcement learning)則堅持更強的「因與果」概念——如果我去介入、甚至以從未試過的方式介入,會發生什麼。這個區別很要緊,因為一個建立在相關性上的策略,可能被混淆因子所騙:一個醫院智能體也許看到某種治療與康復相關,但其實是「本來就比較健康的病人」被給了那種治療。
這個框架借自因果推論:結構因果模型,以及介入與反事實的語言,讓智能體能對「do 式」的動作、而非僅僅對觀測進行推理。這在好幾個地方都有回報——處理「記錄策略取決於隱藏因子」的受混淆離線資料、在「共享因果機制但表層統計相異」的環境之間遷移知識,以及藉由鎖定真正驅動獎勵的變數來更有效率地探索。
因果 RL 是一條年輕而有野心的線,承諾更好的遷移、樣本效率與可信賴度;但它倚賴的因果知識本身就很難取得——從資料中發現因果圖是出了名的困難,而錯誤的假設可能把人帶偏。它把 RL 連結到結構因果模型,以及更廣的因果表徵學習計畫。
另见