馬可夫決策過程
馬可夫決策過程(Markov decision process, MDP)
想像一個機器人在格子世界裡。每個時刻它身處某個情境,選一個動作,落到新的位置,並拿到一點獎勵或懲罰。馬可夫決策過程就是把這件事講精確的一套記帳法:它是幾乎所有強化學習問題都會被裝進去的標準數學容器。
形式上,一個 MDP 是五元組:狀態集合 S、動作集合 A、轉移動態(說明每個動作會把你帶到哪)、獎勵函數(給出報酬),以及折扣因子(衡量未來的份量)。智能體的工作就是一步步選動作,讓它預期能收集到的總折扣獎勵最大化。
這套形式化的威力在於:從下棋到調度電網,都能塞進同一副骨架,因此同一組演算法就能對付它們全部。代價是你得事先把狀態、動作、獎勵定得乾淨,而真實問題很少免費奉上這些。
\mathcal{M}=\langle\mathcal{S},\mathcal{A},P,R,\gamma\rangle
一個 MDP 把五樣材料打包成一個元組。
又稱
另見