函數近似
線性函數近似(linear function approximation)
最簡單卻好用的近似器。你先把每個狀態變成一個特徵向量 x(s)——一串描述它的數字——再把它的價值估計成這些特徵的加權和。如果某個特徵衡量的是「到目標的距離」,就由單一一個權重決定它有多重要。整個估計是特徵空間上的一個平面(超平面)。
形式為 v(s; w) = w^T x(s)。它對 w 的梯度恰好就是 x(s),所以更新很乾淨:w <- w + alpha[目標 - w^T x(s)] x(s)。對於預測(策略評估)而言,同策略(on-policy)的線性 TD 是少數有紮實收斂保證的近似情形之一——它會收斂到一個刻畫得很清楚的不動點(TD 不動點),落在最佳線性擬合附近。
線性方法快速、穩定、好分析,但它的好壞完全取決於你的特徵——它只能表示對 x(s) 為線性的東西。古典強化學習很大一部分功夫,就是設計特徵(瓦片編碼、RBF),好讓上層一個線性層就夠用。深度強化學習則把這個建特徵的工作自動化了。
\hat v(s;\mathbf w)=\mathbf w^\top \mathbf x(s)=\sum_i w_i\,x_i(s)
線性價值:狀態特徵的加權和;其梯度恰為特徵向量。
又称
另见