蒙地卡羅與時間差分學習

n 步時間差分(n-step temporal-difference)

n 步時間差分學習,就是把 n 步回報當作目標的時間差分。TD(0) 把一個狀態的價值朝一步估計挪動,而 n 步時間差分則把它朝「n 個真實獎勵之和,加上其後的自助價值」挪動。透過調整 n,你可以在一步時間差分與蒙地卡羅之間平滑地內插出整個家族,選擇要多相信真實經驗、多相信智能體自己的估計。

實務上的小麻煩是時機。在時間 t 造訪的狀態,它的更新得等再過 n 步、那些獎勵都已知之後才能套用,所以演算法會帶著一點延遲執行,並維持一個近期轉移的小緩衝。回報是:一個結果的功勞會一次往回傳到好幾個狀態,這通常讓學習比起等一步誤差慢慢傳播要快得多。

又称
n-step TD