離線強化學習
策略約束方法(policy-constraint methods)
對付分布偏移最簡單的防線:別讓學到的策略偏離那個產生資料的策略太遠。策略約束方法明確地把新策略綁在行為策略上,使它只能在資料確實支撐的範圍內改良。
具體上,它們在學到的策略與行為策略的估計之間加上一個懲罰或硬約束——KL 散度、MMD 距離,或支撐集約束。最佳化器於是要在「把價值做大」與「待在資料的舒適圈內」之間取捨。
其中的張力是根本性的:約束太緊,你就只是複製行為策略、毫無改良;約束太鬆,外推誤差又會大舉回流。如何調這個旋鈕,以及約束「動作的支撐集」而非確切的分布,正是穩健方法與脆弱方法的分野。
\max_{\pi}\ \mathbb{E}_{a\sim\pi}[Q(s,a)]\quad\text{s.t.}\quad D_{\mathrm{KL}}\!\left(\pi(\cdot\mid s)\,\|\,\pi_\beta(\cdot\mid s)\right)\le\epsilon
在 KL 意義下貼著行為策略的前提下,把價值最大化。
又稱
另見