離線強化學習
離線分布偏移(distributional shift in offline RL)
你的資料集呈現的是舊行為策略之下發生過的事。但你那個改良後的新策略一旦開始做出不同選擇,就會把系統帶往舊策略很少、甚至從未造訪的情境。資料中的狀態—動作分布,與學到的策略實際誘發的分布,兩者之間的落差就是分布偏移,它是離線強化學習的核心病灶。
它會兩度作祟。訓練時,貝爾曼回填會在下一個狀態查詢由學到的策略所選動作的價值,而這些動作可能落在分布之外;部署時,策略會走進資料從未涵蓋的狀態,等於從沒被教過該怎麼辦。
由於沒有線上互動可以糾正這些錯誤,誤差會無聲地累積。幾乎每個離線演算法骨子裡都是對同一個問題的不同回答:怎樣讓策略別去依賴我們一無所知的那部分世界?
又称
另见