馬可夫決策過程
馬可夫獎勵過程(Markov reward process, MRP)
馬可夫獎勵過程是一個被拿掉方向盤的 MDP。仍然有狀態,世界仍然靠機率從一個狀態走到下一個,獎勵也仍然一路到來,但沒有動作、沒有什麼要決定。它描述的是一個你只能看著它展開的系統,就像一枚自顧自漂流的棋子,一路發放報酬。
抽掉選擇,使 MRP 成為在處理控制之前研究價值的乾淨場域。每個狀態都有一個價值,等於從它往後賺得的期望折扣獎勵,而這個價值滿足一條線性的貝爾曼方程;在有限情形下,你能用線性代數直接把它解出來。MDP 恰好就是在 MRP 之上加回一層決策;在 MDP 中固定一個策略,就把它塌縮成一個 MRP,這正是策略評估所建基的想法。
V(s)=R(s)+\gamma\sum_{s'}P(s'\mid s)\,V(s')
MRP 的價值滿足一條線性的貝爾曼方程。
又称
另见