回報、價值與策略

剩餘回報(reward-to-go/partial return)

剩餘回報是回報中還在你前方的那一部分。站在時間步 t,你不在乎已經收到的獎勵——它們是沉沒的、固定的、過去的。對你此刻所做的決策真正要緊的,是你從這一點起仍能賺到的一切:那個部分的、剩下的回報。它和完整回報是同一個量,只是從一條較晚的起跑線量起。

它是從第 t 步起算的那些折扣獎勵的尾端總和。這個想法讓策略梯度演算法更銳利:要把某個結果歸功給一個動作時,只有發生在它之後的獎勵才該算數,因為一個動作無法影響過去。用剩餘回報取代整回合的回報,會把每個動作訊號裡無關的較早獎勵移除,這在不引入任何偏差的情況下降低變異、加快學習。

G_t = \sum_{k=t}^{T}\gamma^{k-t} r_{k+1}

剩餘回報只計入從第 t 步起賺到的獎勵。

又称
reward to gofuture return