動態規劃

策略評估(policy evaluation)

在改進一套策略之前,你得先知道它現在有多好。策略評估(policy evaluation)回答一個很窄的問題:如果我一直遵循這個固定的策略,從每個狀態出發,長期下來大概能拿到多少獎勵?它不嘗試尋找更好的策略——只是衡量你手上這一個。

形式上,它計算給定策略的狀態價值函數。因為一個狀態的價值等於即時獎勵加上你接下來落腳處的折扣價值,這些價值會滿足一組線性方程——每個狀態一條的貝爾曼期望方程。在模型已知時,你可以直接解這組方程,或者更常見地,反覆套用期望回溯,直到價值不再變動為止。

v_\pi(s)=\sum_a \pi(a\mid s)\sum_{s',r}p(s',r\mid s,a)\big[r+\gamma v_\pi(s')\big]

固定策略下的貝爾曼期望方程。

又称
the prediction problem