蒙地卡羅與時間差分學習

自助與抽樣的取捨(bootstrapping vs sampling)

這是整個章節據以組織的那條軸線。自助(bootstrap)是用你自己當前的價值估計來組成更新目標,就像時間差分學習所做的;抽樣(sample)則是用展開到結尾的完整、真實回報來組成它,就像蒙地卡羅所做的。幾乎每一種價值學習方法都是這兩者某種特定的混合,而選擇這個混合,是強化學習中最核心的設計決定之一。

這個混合是一場偏差–變異數的取捨。自助用單一個估計取代嘈雜的未來獎勵,大幅削減變異數,但只要那些估計有誤就注入偏差——而且和函數近似結合時還可能發散。抽樣只用真實結果,所以無偏,但變異數高,又被迫等回合結束。n 步回報與 lambda 參數的存在,正是為了讓你在兩者之間平滑滑動,找到那個最佳甜蜜點。

又称
bootstrapping versus samplingTD vs MC tradeoff