回報、價值與策略
回報分解(return decomposition)
回報分解是支撐幾乎所有基於價值的強化學習的那個小小代數技巧。從現在起的回報,就是下一個獎勵,加上從下一步起算的折扣回報。你一次剝掉一個獎勵,而剩下的東西和你一開始的形狀一模一樣——還是一個回報,只是晚了一步,並乘上了 gamma。
寫出來就是:時間 t 的回報,等於下一個獎勵,加上 gamma 乘以時間 t 加一的回報。取期望值後,這條遞迴就變成貝爾曼方程;這正是從一條定義通往可用更新的橋樑。它也解釋了學得的價值函數為何如此有用:它讓你能用「下一個狀態價值的估計」去取代未知的未來尾巴,於是你可以從單一一次轉移中學習,而不必等整個回合結束。
G_t = r_{t+1}+\gamma G_{t+1}
回報一步步展開:下一個獎勵,加上折扣後的其餘部分。
又称
另见