馬可夫決策過程

部分可觀測馬可夫決策過程(partially observable MDP, POMDP)

普通的 MDP 假設智能體能精確看見真實狀態。POMDP 拿走了這份安心:智能體只收到部分、含雜訊的觀測,必須猜測真正發生了什麼。想想看不到對手手牌的撲克玩家,或在黑暗房間裡靠不穩定感測器導航的機器人;手上的資訊是線索,而非全部真相。

形式上,POMDP 在 MDP 之上加了一個觀測集合與一個觀測模型,把隱藏狀態連結到智能體實際感知到的東西。由於單一觀測不再是馬可夫的,要把動作做好就得記住歷史,通常摘要成一個信念狀態,也就是「你可能在哪」的機率分布。POMDP 遠比 MDP 更貼近現實,也遠更難解,這正是為什麼許多現代 RL 即使假裝不是,實際上仍悄悄運作在這個情境裡。

又称
POMDP