馬可夫決策過程
轉移動態(transition dynamics)
轉移動態是世界的規則:給定你在哪、做了什麼,你會落到哪裡?推一扇門,它通常會開,但在結冰的地板上,你的一步可能滑向意料之外的地方。動態同時刻畫了動作可靠的後果,以及環境可能拋出的真正隨機性。
數學上,動態是一個條件機率:在某個狀態採取某個動作後,落到每個下一狀態的機會。它與獎勵函數一起,完整地規定了 MDP 的行為。在基於模型的 RL 中,智能體試圖學到(或被給定)這個動態並據此規劃;在無模型的 RL 中,它從不把它寫下來,而是直接從採樣到的經驗學價值或策略。
P(s'\mid s,a)=\Pr(s_{t+1}=s'\mid s_t=s,a_t=a)
對每個狀態-動作對,給出下一狀態的機率分布。
又称
另见