蒙地卡羅與時間差分學習
TD(λ)(lambda 時間差分)
TD(λ) 不強迫你在「一步時間差分更新」和「完整蒙地卡羅回報」之間二選一,而是把它們全部一次混合起來。它組成 lambda-回報(lambda-return),也就是一步、兩步、三步乃至更長回報的加權平均,視野每多一步,權重就再乘上一個 lambda 因子衰減。介於零與一之間的參數 lambda,是一個控制智能體實際上往前看多遠的單一旋鈕。
這個旋鈕橫跨整個光譜。lambda 為零時,lambda-回報收縮成單純的一步 TD(0) 目標;lambda 為一時,它變成完整的蒙地卡羅回報。中間的值通常學得最快,比 TD(0) 捕捉到更多真實的未來,同時又比蒙地卡羅的雜訊小得多。TD(λ) 可以用資格痕跡(eligibility traces)有效率地線上計算,不必把整個回合存起來。
G^{\lambda}_t = (1-\lambda)\sum_{n=1}^{\infty}\lambda^{n-1}G_{t:t+n}
lambda-回報:所有 n 步回報的幾何加權混合,由 lambda 掌控。
又称
另见