馬可夫決策過程

半馬可夫決策過程(semi-Markov decision process, SMDP)

一般的 MDP 像節拍器般滴答作響:每個動作恰好佔一步。半馬可夫決策過程放鬆了這點,讓每個動作在下一次該決策之前,佔用一段可變、甚至隨機的時間。選擇開車去機場可能佔掉四十分鐘,而看一眼後照鏡只花兩秒,但兩者都是智能體先做出承諾、再等它走完的單一決策。

「半馬可夫」這個名字標示:這個過程在決策點上是馬可夫的,但在其間的每一瞬間並不是,因為你停留多久是有影響的。獎勵在等待的區間裡累積,折扣也必須計入流逝的時間,於是貝爾曼方程多了一個關於時長的項。SMDP 是 RL 中時間抽象的自然語言:選項框架,也就是智能體挑選各自會跑許多低階步的高階技能,形式上就是一個 SMDP。

又称
SMDP