函數近似
擬合值迭代(fitted value iteration, FVI)
函數近似世界裡的值迭代。古典值迭代會掃過每個狀態,把它的價值換成最好的單步回填;當狀態多到數不完時你做不到這件事。擬合值迭代改而抽樣一批狀態,替每個算出回填目標,再用回歸把一個函數近似器擬合到這些(狀態, 目標)配對上。然後如此反覆。
每次迭代有兩步:先對抽樣到的轉移算目標 y_i = max_a [r + gamma v_old(s'_i)],再回歸出 v_new,使它對這些目標的平方誤差和最小。近似器與貝爾曼回填交替進行。若在上確界範數下有收縮、且每輪都完美擬合,它會收斂;但實務上每一步回歸都會引入近似誤差。
危險在於:擬合是在加權 L2 範數下的投影,但貝爾曼回填只在上確界範數下收縮——兩者未必能複合成一個收縮,所以誤差可能累積、甚至發散。擬合 Q 迭代是它的動作價值版本,也是更常用的形式。
y_i=\max_a\big[r_i+\gamma\,\hat v_{\text{old}}(s_i')\big];\quad \hat v_{\text{new}}=\arg\min_{\mathbf w}\sum_i\big(\hat v(s_i;\mathbf w)-y_i\big)^2
每一輪:先做取 max 的目標,再把價值函數回歸到它們上。
又称
另见