動態規劃
自助法(bootstrapping)
要更新你對某狀態價值的猜測,你可以等整個回合結束、用實際拿到的總獎勵——也可以現在就用你對下一狀態的當前猜測來更新它。後面這個捷徑,靠自己的估計去改進自己的估計,就叫自助法(bootstrapping):抓著自己的鞋帶把自己提起來,用估計去教估計。
每一個動態規劃回溯都在自助——一個狀態的新價值,是由它後繼狀態已存的價值建起來的,而不是由觀察到的最終結果。時間差分法也是如此。相反的是蒙地卡羅,它用完整的回報、不做自助。自助讓更新更快、變異更低,也讓你在回合結束前就能學習,但它引入了偏誤,並且可能與函數逼近和離策略訓練產生不良交互作用。
V(s)\leftarrow V(s)+\alpha\big[\,r+\gamma\,\underbrace{V(s')}_{\text{bootstrap}}-V(s)\big]
一次時間差分更新:目標值依賴對下一狀態的當前估計。
與統計學的拔靴法(對資料重抽樣)無關;在強化學習裡,它單純指用其他估計去更新一個估計。
另见