回報、價值與策略
貝爾曼最佳方程(Bellman optimality equation)
貝爾曼最佳方程,就是把期望方程裡的「取平均」換成「取最大」。它說一個狀態的最佳價值,等於那個唯一最佳動作帶來的獎勵,加上該動作所通往之處的折扣最佳價值。「最佳地行動」這句話藏著一個自我指涉的真理:要現在最佳,你就採取最好的即時動作,然後永遠都最佳地行動下去。
對動作價值而言,它說某個狀態–動作對的 Q-star,等於期望的即時獎勵,加上下一個狀態折扣後的最大最佳動作價值。和期望方程不同,因為那個最大值,它是非線性的,但它有唯一解,而那個解就是最佳價值函數。價值迭代與 Q 學習都是靠反覆把這條關係當成更新來運作;每一輪掃過都把估計拉得更靠近 Q-star,而從 Q-star 出發,挑選那個取到最大的動作,最佳策略就自然浮現了。
Q^*(s,a)=\sum_{s'}P(s'\mid s,a)\Big[r+\gamma\max_{a'}Q^*(s',a')\Big]
最佳動作價值:即時獎勵,加上折扣後的最佳下一動作價值。
另见