強化學習理論
離線強化學習(offline reinforcement learning)
離線強化學習完全從一個固定、事先收集好的資料集學習策略,沒有任何在真實環境中嘗試的機會。這就像只看別人行車記錄器的影片學開車:你能研究發生過什麼,卻永遠無法測試一個你從沒看過的操作。
核心障礙是分布偏移(distributional shift)。學到的策略難免會查詢資料集幾乎沒涵蓋的動作,而自助式(bootstrapped)Q 函數會對這些未見動作外推,產生劇烈且通常偏樂觀的誤差,代理人接著就去追逐它們。對策可分為:把學習者約束在接近產生資料之行為的策略約束、對缺乏支撐之動作抱持懷疑的價值悲觀,以及重要性加權。離策略評估(off-policy evaluation)——不實際執行就評斷一個策略——本身就是個困難的子問題。
再多同一種狹隘行為的資料也治不好這個問題;真正重要的是覆蓋度,也就是對新策略實際會造訪的狀態-動作區域要有支撐。
離線強化學習的失敗不在資料太少,而在覆蓋太窄;就算有龐大但行為單一的資料集,策略仍得靠外推。
又稱
另見