函數近似
殘差梯度法(residual gradient methods)
半梯度 TD 的「誠實」替代品。先把貝爾曼誤差定義成一個價值與它自身單步回填之間的落差,再對其平方誤差做真正的梯度下降——同時對預測與自舉目標求導。因為它是對一個真實目標的貨真價實梯度,所以保證收斂,即使在離策略下也是。
它最小化均方貝爾曼誤差,即 (r + gamma v(s') - v(s))^2 的期望,並對半梯度所忽略的 gamma v(s') 項求梯度。穩定是有代價的:這個目標需要對後繼狀態取兩個獨立樣本的梯度(雙重抽樣問題),而最小化貝爾曼誤差往往收斂到一個比投影(TD)不動點更差、更模糊的解。
所以殘差梯度穩定卻常常又慢又偏向把價值抹糊;半梯度快卻可能發散;梯度 TD(MSPBE)的發明就是要兼得兩者之長——既有收斂保證,又仍以更好的 TD 不動點為目標。搞清楚你在最小化哪一種誤差(貝爾曼誤差還是投影貝爾曼誤差)是關鍵的分野。
\mathbf w\leftarrow \mathbf w-\alpha\,[\,r+\gamma\hat v(s')-\hat v(s)\,]\big(\gamma\nabla\hat v(s')-\nabla\hat v(s)\big)
殘差梯度:梯度同時穿過後繼狀態項。
貝爾曼誤差與投影貝爾曼誤差是不同的目標——殘差梯度最小化前者,TD 與梯度 TD 最小化後者。
又稱
另見