進階策略優化
信賴域線搜尋(trust-region line search)
TRPO 從 KL 約束的二次模型算出一個搜尋方向,再把它縮放到模型認為仍落在信賴域內的最大步。但模型只是近似,所以這個完整步可能悄悄違反真正的 KL 界、甚至讓真實的代理目標下降。線搜尋就是抓出這件事的安全檢查:它先試完整步,若實際 KL 太大、或代理目標沒有改善,就把步縮小再試。
在機制上這是一個回溯迴圈。反覆把步長減半,每次都在提議的策略上量測實證 KL 與代理目標,接受第一個「同時滿足 KL 約束、又有正向改善」的候選。若所有縮小後的步都不行,TRPO 就乾脆跳過這一輪的更新。這道護欄把近似的自然梯度方向,轉化成一個你真能信任的步,也是 TRPO 表現如此穩定的核心原因之一。
\theta_{k+1}=\theta_k+\alpha^{j}\,\Delta\theta,\qquad j=0,1,2,\dots\ \text{until KL}\le\delta\ \text{and}\ L\ \text{improves}
以係數 alpha 回溯,直到 KL 約束成立且代理目標有改善。
又称
另见