蒙地卡羅與時間差分學習
蒙地卡羅預測(Monte Carlo prediction)
想像你想知道某個西洋棋開局到底有多好。你沒辦法直接從規則手冊讀出答案,於是就從那個局面實際下很多盤完整的棋,再把結果平均起來。蒙地卡羅預測對一個固定策略做的正是這件事:要估計某個狀態的價值,它跑完整的回合(episode),然後把每次智能體經過該狀態之後實際得到的回報(return,也就是後續折扣獎勵的總和)平均起來。
這個方法純粹靠經驗:它不需要環境的模型,只需要終究會結束的回合。因為它是從真實、完整的回報學習,而不是從別的猜測學習,所以估計是無偏的,隨著回合越來越多會收斂到真實價值。代價是耐心與雜訊:你必須等每個回合跑完才能更新,而且單一一次的好運或壞運就可能讓回報大幅擺動,因此估計的變異數很高。
V^{\pi}(s)\approx\frac{1}{N}\sum_{i=1}^{N}G^{(i)}
一個狀態的價值,用造訪它之後得到的 N 個回報的平均來近似。
蒙地卡羅只適用於會終止的任務;對永不結束的任務,你需要像時間差分這類會自助(bootstrapping)的方法。
又称
另见