動態規劃
貝爾曼回溯算子(Bellman backup operator)
「回溯」是把你接下來可能去的地方的價值,推回到你現在所在的狀態上。貝爾曼算子(Bellman operator)把這件事包裝成一台數學機器:餵給它一整張價值估計表,它就還給你一張全新、更好的表。把一輪完整掃描看成「套用一個算子」,就能把「執行演算法」改寫成「一再套用同一個函數」。
它有兩個版本。期望算子對固定策略所採取的動作取平均;最適算子則對動作取最大值。兩者都把一個價值函數映射成新的價值函數,方法是把即時獎勵加上後繼狀態的折扣價值。迭代策略評估就是不斷套用期望算子;價值迭代就是不斷套用最適算子。兩者各自都有唯一的不動點。
(T^*v)(s)=\max_a\sum_{s',r}p(s',r\mid s,a)\big[r+\gamma v(s')\big]
最適算子 T* 把一張價值表轉成下一張。
又稱
另見