進階策略優化

鏡像下降策略優化(mirror descent policy optimization, MDPO)

鏡像下降(mirror descent)是梯度下降的一種推廣,用於那些「衡量距離的自然方式並非單純歐氏」的問題。透過這個視角看策略優化,會得到一個乾淨而統一的說法:每次更新都最大化「期望優勢,減去一個懲罰偏離當前策略的散度項」,而這個散度通常就是策略之間的 KL。在每一步解這個小小的取捨問題,你幾乎免費就得到一個有原則的信賴域更新。

這個視角之所以有啟發性,是因為熟悉的演算法都成了它的特例。自然策略梯度,是以 KL 散度為幾何的鏡像下降;TRPO,是把軟懲罰換成硬 KL 約束的鏡像下降;而 PPO 可讀作一次近似的鏡像下降步。這樣鋪陳,能向成熟的鏡像下降理論借來收斂保證,也釐清了為何「KL 正則化的更新」是正確的基本原語——正是同一種正則化,穩定了最大熵 RL 與 RLHF。

\pi_{k+1}=\arg\max_\pi\ \mathbb{E}\big[A^{\pi_k}\big]-\tfrac{1}{\eta}\,D_{\mathrm{KL}}\!\big(\pi\,\|\,\pi_k\big)

每一步最大化「優勢」減去把策略拉回當前策略的 KL 項。

又称
MDPOpolicy mirror descent