蒙地卡羅與時間差分學習

n 步回報(n-step returns)

n 步回報是介於一步時間差分與完整蒙地卡羅之間的實用折衷。智能體不在走一步後就自助,而是往前走、把它實際收到的前 n 個真實折扣獎勵存下來,然後才把它對所抵達狀態的當前價值估計接上去。把 n 設成一,你就回到 TD(0) 目標;讓 n 一路長到回合結束,你就回到完整的蒙地卡羅回報。

選擇 n 是在兩種誤差之間權衡。小的 n 重度依賴智能體自己的價值估計,所以變異數低,但會繼承那些估計帶有的偏差。大的 n 用到更多真實獎勵,降低偏差,卻讓隨機結果累積成更大的變異數。中間的 n 值通常學得最快,這正是為什麼 n 步方法位於現代演算法的核心。

G_{t:t+n}=r_{t+1}+\gamma r_{t+2}+\cdots+\gamma^{n-1}r_{t+n}+\gamma^{n}V(s_{t+n})

n 步回報:n 個真實的折扣獎勵,接著從第 n 步的價值自助。

又稱
n-step returntruncated return