函數近似

投影到價值空間(projection onto value space)

一種看清近似 TD 究竟在算什麼的幾何觀點。真正的價值函數住在一個巨大的空間裡(每個狀態一個維度);你的近似器只能表示其中很小的一片——由你的特徵所能表達的那些價值函數,一個低維的子空間。每當貝爾曼回填把你推出這個子空間,你就得投影回最接近的可表示函數,回到子空間裡。

令(在同策略狀態加權的 L2 範數下)投影到可表示子空間的算子為一個映射,並令貝爾曼算子作用在某策略上。半梯度 TD 會收斂到合成映射「先回填、再投影」的不動點——也就是那個經過「先回填、再投影」後不變的價值。梯度 TD 方法則直接最小化回填後價值與其投影之間的距離,也就是投影貝爾曼誤差。這幅圖解釋了為何 TD 的解會異於最佳擬合。

微妙之處在於:貝爾曼算子在最大範數下收縮,投影卻在加權 L2 範數下收縮;它們的合成在同策略下是收縮(所以 TD 收斂),離策略下卻未必(所以可能發散)。正是這一處不匹配,撐起了致命三要素與大部分近似強化學習理論。

\hat v_{\text{TD}}=\Pi\,T^\pi \hat v_{\text{TD}};\qquad \text{MSPBE}=\lVert \Pi T^\pi \hat v-\hat v\rVert_D^2

TD 的解是「先回填、再投影」的不動點。

又称
projected Bellman error geometry