蒙地卡羅與時間差分學習
蒙地卡羅控制(Monte Carlo control)
預測告訴你一個策略有多好;控制則是要讓它變得更好。蒙地卡羅控制在兩個動作之間來回循環:跑完整的回合、把回報平均起來,藉此估計每個動作有多好,然後悄悄改成偏好看起來最好的動作。如此反覆,策略就一階一階往上爬——這就是強化學習裡到處都用的廣義策略迭代(generalized policy iteration)概念,只是這裡完全靠抽樣得來的經驗驅動,而不是已知的模型。
有一個關鍵轉折:要在沒有模型的情況下改進策略,你必須估計動作價值 Q(s,a),而不只是狀態價值,因為你需要直接比較各個動作。而一味貪婪地追逐當前最好的動作,會讓你永遠發現不了更好的選項,所以控制必須持續探索——靠探索起點(exploring starts),或維持柔性的 epsilon-貪婪策略——讓每個動作都持續被抽樣、被重新評估。
又称
另见