動態規劃

貝爾曼算子的不動點(fixed point)

不動點是一個函數動不了的輸入——套用這個函數,你會拿回同樣的東西。對貝爾曼算子來說,不動點就是那個自洽到「再回溯一次也不會改變任何東西」的價值函數:每個狀態的價值,已經等於它所推出的「獎勵加折扣後繼價值」。那個特別的價值函數,正是動態規劃在追尋的目標。

期望算子有唯一的不動點,也就是其策略的價值;最適算子有唯一的不動點,也就是最佳價值函數。貝爾曼方程說的正是「價值函數等於它自己的回溯」。因為算子是壓縮映射,不動點唯一,且任何初始猜測都會收斂到它——這就是價值迭代與策略評估之所以有效、以及它們停在哪裡的原因。

v_*=T^*v_*,\qquad v_\pi=T^\pi v_\pi

最佳價值與策略價值,分別是兩個算子的不動點。