函數近似
梯度時間差分學習(gradient temporal-difference, gradient TD)
一般的 TD 配上函數近似,在離策略(off-policy)下可能發散(估計值爆掉)。梯度 TD 方法(gradient TD)的修法是誠實面對自己在最佳化什麼:它對一個定義良好的誤差目標做真正的梯度下降,因此即使把線性近似、離策略資料與自舉三者湊在一起——也就是讓一般 TD 崩潰的那個情境——它依然保證收斂。
它們用隨機梯度下降去最小化「均方投影貝爾曼誤差」(MSPBE)。麻煩在於這個誤差的梯度含有對同一個後繼狀態的兩個期望的乘積,單一樣本無法無偏地估計它。GTD2 與 TDC 用第二組權重去追蹤其中一個期望(一種雙時間尺度技巧)來解決,從而得到一個正確的隨機梯度。
代價是多了一個學習率要調,而且當一般 TD 剛好能用時,它學得比一般 TD 慢一些。它們是對致命三要素的原則性解答,但在深度強化學習裡,實務者往往偏好更便宜的穩定手段(目標網路、回放)——在實務上夠用就好。
\text{MSPBE}(\mathbf w)=\lVert \Pi\,T^\pi \hat v_{\mathbf w}-\hat v_{\mathbf w}\rVert_D^2
梯度 TD 對均方投影貝爾曼誤差做下降。
又稱
另見