JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

超越標準 MDP

真實世界部分被遮蔽、有時會變動、且在多個時間尺度上運作。三種延伸把 MDP 撐大來貼合它——也告訴你何時用樸素版本就夠了。

當你看不見完整的狀態

標準 MDP 假設智能體能看見真實狀態。現實常常藏起其中一部分:撲克玩家看不到對手的牌;機器人的攝影機照不到它背後。這就是部分可觀測 MDP(partially observable MDP,POMDP)。智能體不再收到狀態——只收到一個暗示著狀態的觀測

這件事很重要,因為馬可夫性質現在對觀測失效了:單一瞥見並不是過去的充分摘要。兩個本質不同的處境可能產生相同的觀測、卻需要不同的動作——而一個只對最新觀測做反應的智能體,會把它們搞混。

信念狀態:對隱藏之事下注

優雅的修補方式是信念狀態(belief state):智能體不去猜那唯一的真實狀態,而是維護一個涵蓋它可能身處的所有狀態的機率分布,並隨著新觀測到來而更新。「我有 70% 把握門是鎖著的、30% 把握它是開的。」

信念状态通过贝叶斯更新来维护:每个新观测都会重塑对隐藏状态的概率分布。

交互式贝叶斯更新:随着证据到来,将先验分布转化为后验分布。

美妙之處在於:信念狀態本身是馬可夫的,即便觀測不是。每個信念都是整段觀測歷史的充分摘要,所以一個 POMDP 就變成了一個以信念為狀態的普通 MDP。代價是,這個「信念 MDP」活在一個連續、高維度的空間裡——精確解通常難以處理,實務上智能體會學著去近似信念,常常靠遞迴網路(recurrent networks)建出來的記憶來辦到。

當規則本身改變時

標準 MDP 還假設動態與獎勵維持固定——一個穩態(stationary)的世界。但市場會變、機械會磨損、對手會適應。在一個非穩態的 MDP 裡,轉移獎勵會隨時間漂移,所以上個月還最佳的策略,可能悄悄就過時了。

马尔可夫链固定的转移概率——在非平稳 MDP 中,正是这些概率会随时间漂移。

交互式马尔可夫链:状态之间由转移概率箭头相连。

注意這跟隨機性環境不一樣。隨機性是固定的隨機——骰子永遠不變。非穩態則是骰子本身在變。常見的應對是持續不斷地學習、把近期經驗的權重加重、或者把時間(或一個情境指標)摺進狀態,讓這個放大後的問題重新變回穩態。

需要時間的動作:半馬可夫 MDP

樸素的 MDP 一次只滴答一個等長的步。但「導航到廚房」花的時間比「旋轉 5 度」長得多。半馬可夫決策過程(semi-Markov decision process,SMDP)讓動作能持續不等長的時間,會追蹤每個動作跑了多久,並依其真實的持續時間對獎勵打折。

Q(s,a)=\mathbb{E}\!\left[\,R+\gamma^{\tau}\,\max_{a'}Q(s',a')\right]

半马尔可夫决策过程的价值更新用 γ 的 τ 次方进行折扣,其中 τ 是动作持续的步数,使较长的技能按其耗时来加权。

SMDP 是時間抽象(temporal abstraction)的形式骨幹:把延展的技能當成單一決策來看待。它們撐起了選項框架(options framework)與階層式強化學習,在那裡,高層策略挑選技能(「把門打開」),低層策略執行具體的肌肉動作。對一個乾淨、完全可觀測、等長步的任務,你完全用不到這些——但這正是強化學習如何擴展到長程、有結構、真實世界問題的方式。