動態規劃

迭代策略評估(iterative policy evaluation)

精確求解價值方程意味著要反轉一個大矩陣,當狀態很多時並不實際。迭代策略評估用一個便宜的方式得到同樣的答案:先從一個粗略的猜測出發,再不斷修正。你反覆把每個狀態的價值換成由鄰居當前價值算出的更好估計——就像「現在情況有多好」的消息,一次一步地在狀態空間裡擴散開來。

每一輪掃描都對所有狀態套用貝爾曼期望回溯:新的價值等於期望即時獎勵,加上在當前估計下、下一個狀態的折扣期望價值。由於這個回溯是壓縮映射,每一輪掃描都讓誤差朝零縮小,無論初始猜測為何,迭代值都會收斂到該策略的真實價值。當一輪掃描中最大的變動小於某個微小門檻時就停止。

v_{k+1}(s)=\sum_a \pi(a\mid s)\sum_{s',r}p(s',r\mid s,a)\big[r+\gamma v_k(s')\big]

期望回溯的一輪掃描,從估計 k 到 k+1。