強化學習理論
隨機逼近(stochastic approximation)
隨機逼近是「靠許多帶雜訊的小步逼近目標」的數學。你算不出真正想要的量——比方說一個期望值——但你可以對它取帶雜訊的估計,只要用恰當的方式平均,仍然能逼近真值。Q-學習、TD 學習與策略梯度,本質上都是偽裝過的隨機逼近演算法。
這個奠基結果出自羅賓斯(Robbins)與門羅(Monro),把更新視為某個確定性迭代的帶雜訊版本,而你要的正是該迭代的不動點。在步長遞減、雜訊零均值且變異有界的條件下,隨機軌跡會緊貼底層的平均動態——這由「ODE 方法」講得精確:離散更新漸近地沿著一條平滑的常微分方程走向其平衡點。
這套理論是漸近的:它告訴你迭代最終落在哪,不告訴你多快,而「最終」裡藏的常數可能大得驚人。它還假設平均更新場性質良好;在函數近似下這個假設可能崩潰,這就是為什麼深度強化學習的收斂從來不是免費保證的。
\theta_{t+1}=\theta_t+\alpha_t\big(h(\theta_t)+\xi_t\big),\quad \mathbb{E}[\xi_t]=0
一個隨機逼近步:真實更新方向 h 加上零均值雜訊 ξ。
另見