蒙地卡羅與時間差分學習
首次造訪蒙地卡羅(first-visit Monte Carlo)
在單一回合裡,智能體可能好幾次經過同一個狀態。首次造訪蒙地卡羅用一個嚴格的規則處理這件事:每個回合裡,它只記錄該狀態第一次出現之後得到的回報,同一回合中後面的造訪一律忽略。把這些首次造訪的回報跨許多回合平均起來,就得到該狀態的價值估計。
這條規則背後是統計上的乾淨:每個回合對每個狀態最多貢獻一個回報,而這些回報是對同一個量的獨立樣本,所以平均是一個無偏估計,並以常見的「一除以根號 N」速度收斂到真實價值。它之所以是教科書的預設選擇,正是因為它的行為很容易推理。
又称
另见