強化學習理論

羅賓斯–門羅條件(Robbins–Monro conditions)

這是步長序列要讓隨機逼近收斂所必須遵守的兩條規則。直覺上,步長加總起來要夠大,才能走到演算法可能需要的任何距離——所以總和必須發散;但最終又要夠小,才能把隨機雜訊壓掉——所以平方和必須收斂。步長一直太大永遠安定不下來;縮得太快則還沒到目標就熄火。

標準排程 α_t = 1/t 同時滿足兩者:調和級數發散,而 1/t² 的總和收斂;更一般地,α_t = c/t^p 對任何介於 (1/2, 1] 的指數 p 都成立。實務上許多深度強化學習系統會刻意違反這些條件,改用很小的固定步長,以漸近收斂換取「追蹤緩慢移動的目標」以及在非穩態問題上的純粹穩定性。

\sum_{t=1}^{\infty}\alpha_t=\infty,\qquad \sum_{t=1}^{\infty}\alpha_t^{2}<\infty

兩條羅賓斯–門羅條件:步長總和發散,步長平方和有限。

又称
Robbins–Monro step-size conditions