蒙地卡羅與時間差分學習
每次造訪蒙地卡羅(every-visit Monte Carlo)
每次造訪蒙地卡羅是首次造訪法比較隨性的兄弟。它不只算一個狀態在回合裡第一次出現,而是把該狀態每一次出現之後的回報都算進去,再全部平均。如果一個狀態在一個回合裡出現三次,那三次後續的回報都會餵進估計。
這樣每個回合用到更多資料,當造訪很稀少時會有幫助,但它放棄了首次造訪那種乾淨的獨立性。同一回合裡重複造訪得到的回報彼此重疊、互相相關,所以在任何有限樣本下這個估計都是有偏的。讓人安心的是,這個偏差會隨回合累積而沖淡:每次造訪蒙地卡羅依然是一致的,會收斂到相同的真實價值,實務上它常常表現得差不多好,而且寫起來更簡單。
又称
另见