蒙地卡羅與時間差分學習

TD(0)(一步時間差分,TD-zero)

TD(0) 是最簡單的時間差分更新,也是第一次認識這個概念的好起點。每當智能體從一個狀態移動到下一個狀態,它就往前看一步:用剛拿到的獎勵,加上它目前賦予新狀態的折扣價值,組成一個目標,然後把舊狀態的價值朝那個目標挪一小步 alpha。整個演算法就這樣。

「往前看一步」正是名字裡那個零的意思——它位於一個家族的一端,這個家族一路延伸到完整的蒙地卡羅。TD(0) 在每次轉移後就線上更新,只需要極少的記憶體,而且在標準條件下可證明會收斂到固定策略的正確價值。它是 SARSA、Q-learning 以及各種深度強化學習方法共同的地基。

V(s_t)\leftarrow V(s_t)+\alpha\,[\,r_{t+1}+\gamma V(s_{t+1})-V(s_t)\,]

TD(0) 的價值更新:把舊估計沿著時間差分誤差挪動一步 alpha。

又称
one-step TDtabular TD(0)