蒙地卡羅與時間差分學習

時間差分誤差(TD error)

時間差分誤差是強化學習的學習訊號:一個告訴智能體該有多驚訝的數字。走了一步之後,它把現在所相信的——剛收到的獎勵,加上新狀態的折扣價值——拿來跟原本對舊狀態的預測比較。兩者之差就是誤差。正值代表結果比預期好,負值代表比預期差。

形式上,一步的時間差分誤差是 delta 等於獎勵加上 gamma 乘以下一個狀態的價值,再減去當前狀態的價值。每一次時間差分更新都只是把舊估計按這個誤差的一個比例挪動,所以 delta 同時決定了學習的方向與幅度。它不只是計算上的技巧:大腦中多巴胺神經元的放電尖峰,追蹤的正是一個非常相似的「獎勵預測誤差」,這也是時間差分學習如此具影響力的原因之一。

\delta_t = r_{t+1} + \gamma V(s_{t+1}) - V(s_t)

一步時間差分誤差:觀察加自助得到的目標,減去當前的預測。

又称
temporal-difference errordelta