强化学习

马尔可夫决策过程(Markov decision process)

/ MAR-kof dih-SIZH-un PROSS-ess /

马尔可夫决策过程,是强化学习据以开局的那张正式棋盘。它把五样东西钉死:你可能身处的种种情形(状态)、你能做的种种动作(动作)、一步之后接下来是哪种情形的规则(转移,可能带随机性)、每步动作赚到的分数(奖励),以及你对未来相比当下有多在乎(折扣)。一个问题一旦这样写下来,整套强化学习的机器便严丝合缝地各就各位。

它的标志性特征——「马尔可夫」那一部分——是一个无记忆假设:下一个状态只取决于当前的状态与动作,而不取决于你是如何一路走到这里的全部历史。在国际象棋这样的棋类游戏里,这是字面上成立的:当前棋子的摆布已告诉你所需的一切,它们以什么顺序到达此处无关紧要。正是这个假设让数学变得可解,因为智能体永远只需看「我现在在哪儿」,而不必看「曾经发生过的一切」。

老实说,难处在于现实世界很少这般客气。自动驾驶汽车单独的一帧画面,并不能告诉你另一辆车的速度——你还需要之前的几帧,所以单凭一张快照并非「马尔可夫」的。从业者的补救办法,是往状态里塞进更多东西(叠上好几帧、加上速度),直到它表现得「够马尔可夫」为止。当你确实看不到完整状态时,问题就变成了「部分可观测」的 MDP,那要难得多。

「蛇梯棋」就是一个干净的 MDP:状态=你所在的格子;动作=掷骰(只有这一种);转移=骰子点数再加上踩到的蛇或梯;奖励=走到最后一格时+1。你的未来只取决于你当下所在的格子——而非你花了多少回合才到这里。

五样配料——状态、动作、转移、奖励、折扣——再加上那条「只有当下要紧」的马尔可夫规则。

马尔可夫性是你强加在状态设计上的一个假设,而非世界本身的属性。如果你的状态漏掉了某样未来所依赖的东西,再好的算法也无法完全弥补——所以强化学习里大量真正的功夫,都花在设计一个「够马尔可夫」的状态上。

又称
MDP马尔可夫决策过程馬可夫決策過程