強化學習理論

策略梯度收斂(policy-gradient convergence)

策略梯度方法沿著期望報酬的梯度,把參數化的策略往高處推。由於這個報酬曲面對參數一般是非凹的,令人擔心的就是最佳化裡的經典問題:梯度上升可能卡在鞍點或差勁的區域最優。收斂理論問的是這些方法究竟落在哪、又多快到達。

實際圖像比「非凹」暗示的更樂觀。在梯度精確時,原始策略梯度會收斂到駐點,而對 softmax 表格式參數化,它可被證明達到全域最優,只是速率慢、是次線性的。自然策略梯度(natural policy gradient)——用費雪資訊矩陣對更新做預條件——收斂快得多,能達到不依賴維度的線性或近 1/T 速率;這是 TRPO 與 PPO 的理論支柱。隨機梯度帶來的變異,則必須由步長以羅賓斯–門羅的方式馴服。

這些強的全域保證仰賴精確或低變異的梯度與良性的參數化。換成深度網路、大變異與有限探索後,只剩駐點保證存活,而「一個駐點」與「最優」之間的實務落差,正是大量工程心力投注之處。

\nabla_\theta J(\theta)=\mathbb{E}_{\pi_\theta}\!\big[\nabla_\theta\log\pi_\theta(a\mid s)\,Q^{\pi_\theta}(s,a)\big]

策略梯度定理;收斂行為取決於梯度變異與參數化方式。