強化學習理論

Q-學習的收斂(convergence of Q-learning)

Q-學習透過把表格中每個動作價值往「報酬加上折扣後的下一最佳價值」推一點點來更新。自然的問題是:這種無止境的微調真的會落在真正最優的 Q 函數上嗎,還是可能永遠震盪?經典定理說會——在表格情形下它以機率一收斂到 Q*——但只在特定條件下。

需要三個要素。第一,每個狀態–動作對都必須被無限次造訪,表格才不會有部分被餓死。第二,步長必須滿足羅賓斯–門羅(Robbins-Monro)條件:總和發散(總移動量夠)但平方和收斂(對雜訊有足夠阻尼)。第三,報酬必須有界。在這些前提下,隨機逼近的論證仰賴貝爾曼最優算子是 γ-壓縮,這釘住了一個唯一不動點,迭代會被拉向它。

這個保證很脆弱。一旦加上函數近似與離策略自助(off-policy bootstrapping)——也就是「致命三元組」——同樣的更新可能發散。表格收斂是乾淨的基準線,深度強化學習的不穩定都是以它為對照。

Q_{t+1}(s,a)=(1-\alpha_t)Q_t(s,a)+\alpha_t\big[r+\gamma\max_{a'}Q_t(s',a')\big]

Q-學習的更新式;收斂需要無限次造訪與羅賓斯–門羅步長。