馬可夫決策過程
平穩與非平穩 MDP(stationary vs nonstationary MDP)
當一個 MDP 的規則靜止不動時,它就是平穩的:轉移動態與獎勵函數在第一步與第一百萬步都一樣。非平穩的 MDP 會在你腳下變動,例如價格漂移、遊戲改版機制、機械磨損,因此昨天管用的配方,明天可能悄悄失效。
多數教科書理論假設平穩性,因為這讓單一固定策略得以成為最佳,也讓智能體能把新舊經驗視為同等有效。非平穩性把這兩點都打破:智能體必須持續適應、給近期資料更高權重,或把那個在變的量折進狀態裡,讓更大的過程重新變得平穩。要注意,即使動態固定,有限視野問題的最佳策略本身就是非平穩的,因為在那裡變動的是剩餘時間。
另見