馬可夫決策過程
馬可夫性質(Markov property)
想像一盤下到一半的棋。要決定最佳一步,你只需看當前局面;你是用瘋狂的棄子還是平靜的開局走到這裡,都無所謂。馬可夫性質正是這個想法:當前狀態已含有你預測與決策所需的一切,而走到這裡的路徑不再提供任何額外資訊。
精確地說,若下一個狀態的分布只取決於當前狀態與動作,而與更早的歷史無關,這個過程就是馬可夫的。正是這點讓 MDP 只需儲存一個小小的狀態,而非不斷增長的日誌,也是讓價值函數與貝爾曼方程成立的前提。當它不成立時,補救之道是把足夠的歷史折進狀態裡,直到它再次成立。
P(s_{t+1}\mid s_t,a_t)=P(s_{t+1}\mid s_t,a_t,s_{t-1},a_{t-1},\dots)
在給定現在的條件下,未來與過去相互獨立。
馬可夫是你狀態表示法的性質,而非世界本身的性質;更豐富的狀態能讓它復原。
又稱
另見