動態規劃

策略改進(policy improvement)

一旦你知道在當前策略下每個狀態有多好,就能在每個狀態問一個更銳利的問題:有沒有某個單一動作,看起來比我的策略在這裡所做的更好?如果有,就換過去。對自己的價值估計採取貪婪選擇,必然會得到一個至少一樣好——而且通常嚴格更好——的策略。

對每個狀態,你計算動作價值,也就是期望獎勵加上下一狀態的折扣價值,再讓新策略選出數值最高的那個動作。策略改進定理證明:這個貪婪策略絕不會比舊的差;而若它與舊策略完全相同,就表示你已經找到最佳策略了。這一步,正是把「衡量」轉化為「進步」的引擎。

\pi'(s)=\arg\max_a\sum_{s',r}p(s',r\mid s,a)\big[r+\gamma v_\pi(s')\big]

新策略對舊策略的價值採取貪婪選擇。