離線強化學習
批次強化學習(batch reinforcement learning)
批次強化學習是離線強化學習的舊稱,源自當時用來對比「線上、逐步更新」的講法。你一次蒐集好一批已記錄的轉移資料,然後在這份固定集合上反覆執行學習演算法,而不是邊蒐集新資料邊學。
經典的批次方法(如擬合 Q 迭代,fitted Q-iteration)把價值學習看成在這批資料上一連串的監督式回歸:用目前的貝爾曼目標把價值函數擬合好,重新計算目標,再擬合,如此循環。迭代之間資料完全不變,變的只有目標。
在現代用法裡,批次強化學習與離線強化學習幾乎同義,只是「離線」更強調一件事:正因批次固定、而學到的策略不斷偏離它,才會引發那些棘手的分布偏移問題。
又称
另见