蒙地卡羅與時間差分學習
資格痕跡(eligibility traces)
當獎勵終於到來,沿途造訪過的哪些狀態值得這份功勞?資格痕跡就是回答這個問題的短期記憶。每個狀態都保有一條痕跡,被造訪時往上跳,然後隨時間淡去。當一個時間差分誤差出現,它會按各狀態當前的痕跡比例廣播出去,於是近期且頻繁造訪的狀態分到最大的一份。
這是實作 TD(λ) 既有效率又「往後回看」的方式。智能體不必等著從未來組出 lambda-回報,而是把痕跡帶著往前走,每一步都更新許多狀態。每個狀態的痕跡在兩次造訪之間,會以折扣 gamma 乘上 lambda 的乘積衰減。結果是更快的功勞分配——單一個延遲的獎勵可以立刻調整一整條先前狀態的軌跡,而不只是最後一個。
e_t(s)=\gamma\lambda\,e_{t-1}(s)+\mathbf{1}[s_t=s]
累加型痕跡:每一步以 gamma-lambda 衰減,每次造訪加一。
又称
另见