馬可夫決策過程
分段式 MDP(episodic MDP)
分段式 MDP 是以一個個自成段落的章節形式出現的。智能體開始、互動一陣子、撞上一個結束,例如贏了遊戲、撞了車、時間用盡,然後世界重置,全新的一段重新開始。電玩關卡的每一次遊玩、或牌局的每一手,都是一段,有清楚的開頭與清楚的停止。
技術上,當智能體到達終止或吸收狀態時一段就結束,此後不再累積任何獎勵。這種結構很方便:回報是一段有界章節上的有限總和、你能比較整段、而那些要等一段結束才學習的蒙地卡羅方法也因此可行。它與從不重置、改靠折扣的持續性任務相對。許多持續性問題會被切成人造的段落,只為了讓學習更容易。
又称
另见