蒙地卡羅與時間差分學習
時間差分學習(temporal-difference learning,TD)
想像你開車去一個不熟的地方。你不會等到抵達才回頭評斷先前對行程的猜測;每過一個路口,你就用剛剛發生的事微調預估到達時間。時間差分學習也是這樣運作:它會立刻更新某個狀態的價值,把舊估計往一步之後做出的、比較新鮮的估計稍微挪過去,而不必等回合結束。
時間差分是著名的兩個世界的融合。像蒙地卡羅一樣,它直接從經驗學習、不需要環境模型;像動態規劃一樣,它會自助(bootstrap)——它把新估計建立在自己當前的估計之上,而不是建立在完整回報之上。這讓它能線上、一步一步地學習,也能用在永不終止的任務上。代價是它追逐的目標本身也只是個猜測,所以時間差分的估計是有偏的,不過通常比蒙地卡羅的雜訊小得多。
自助是時間差分的核心:更新目標裡含有智能體自己的價值估計,而不只是觀察到的獎勵。
又稱
另見