蒙地卡羅與時間差分學習
同策略與離策略學習(on-policy vs off-policy learning)
任何學習中的智能體裡,都有兩個策略悄悄在運作:實際選擇動作、產生資料的行為策略(behavior policy),以及智能體想學習其價值的目標策略(target policy)。同策略學習指這兩者相同——你評估並改進的,正是你正在遵循的策略,例如 SARSA。離策略學習指兩者不同——你一邊照某個策略行動,一邊學習另一個策略,例如 Q-learning 在探索的同時學習最佳策略。
這個區別決定了什麼是可能的。離策略學習更強大、更靈活:它能從探索性的、甚至是舊的記錄資料學到最佳策略,也能重複利用其他智能體或自己早期版本產生的經驗。代價是,從某個策略取得的資料對另一個策略呈現的是被扭曲的圖像,所以離策略方法通常需要校正——最常見的是重要性抽樣——而且往往比同策略的表親們更不穩定。
又称
另见