離線強化學習

離策略評估(off-policy evaluation, OPE)

部署一個新策略之前,你會想知道它到底有多好。離策略評估只憑紀錄資料來回答——用另一個行為策略蒐集到的經驗,去估計一個你從未實際執行過的目標策略的價值。它就是離線強化學習裡那句「這真的會成嗎?」

有三大家族。重要性取樣(importance sampling)用「目標對行為的動作機率比」替記錄的回報重新加權,無偏但變異大;直接法擬合一個模型或價值函數、在其中評估策略,變異小但有偏;雙重穩健(doubly robust)估計把兩者結合,只要其中一項夠好就能保持準確。

離策略評估出了名地難:重要性權重會在長時間跨度上爆炸,而基於模型的估計又繼承了模型誤差。然而它不可或缺——離線強化學習就是靠它來驗證、靠它在不做線上試驗的情況下挑選超參數、也靠它在正式上線前篩除有風險的部署。

\hat V_{\mathrm{IS}}=\frac{1}{n}\sum_{i=1}^{n}\left(\prod_{t}\frac{\pi(a_t\mid s_t)}{\pi_\beta(a_t\mid s_t)}\right)R_i

重要性取樣估計:用目標對行為的機率比,替每一筆記錄的回報重新加權。

又稱
OPEcounterfactual policy evaluation