回報、價值與策略
貝爾曼期望方程(Bellman expectation equation)
貝爾曼期望方程抓住了一個漂亮而簡單的想法:你所在之處的價值,等於你接下來拿到的獎勵,加上你落腳之處的折扣價值。你不必去加總一條沒完沒了的未來獎勵流,只要往前看一步,再信任價值函數去概括其餘的一切。它把無限的前瞻化成一條遞迴關係,而固定策略的價值必須滿足這條關係。
對一個策略而言,它說一個狀態的價值,等於「對策略採取的動作、以及環境產生的下一個狀態取平均」後的即時獎勵,加上下一個狀態的折扣價值。這種自我一致性正是策略評估背後的引擎:如果你的價值估計不滿足這條方程,那個落差就精確地告訴你該怎麼修正它們。時序差分法的核心,其實就是輕推估計,好讓這條方程成立。
V^\pi(s)=\sum_a \pi(a\mid s)\sum_{s'}P(s'\mid s,a)\big[r+\gamma V^\pi(s')\big]
一個狀態的價值,是依策略平均後的獎勵,加上下一個狀態的折扣價值。
又称
另见