强化学习
策略(policy)
/ POL-uh-see /
策略是智能体的行动方针:一条规则,给定智能体当下身处的任何情形,它就说该做什么。如果说状态是问题,那么策略就是答案。它是强化学习最终想要学出来的东西——一旦你有了一个好策略,就可以把所有的试错都丢开,照着它走就行。
说得精确些,策略把状态映射到动作。确定性策略为每个状态给出一个固定动作(「灯红了就停」)。随机性策略则给出概率(「70% 往左、30% 往右」),再掷骰子决定——这有助于让智能体对对手保持难以预料,也有助于在学习中进行探索。策略常用希腊字母 π 表示,它把智能体的全部行为浓缩成一个函数。
「策略」之所以是个如此核心的词,是因为强化学习里其余的一切,都在为找出一个好策略服务。价值函数估计一个策略有多好;贝尔曼方程描述如何改进它;策略梯度方法则直接调整它。一个值得记住的微妙之处:一个策略可以在它受训的那个世界里出类拔萃,却在世界一变的那一刻变得毫无用处,因为它记住的是「该怎么做」,而非理解了「为什么」。
一个简单的红绿灯策略:状态「红」→动作「停」;状态「绿」→「行」;状态「黄」→「减速」。学出来的游戏策略是同一个想法,只是大得多——对每一种可能的屏幕画面,它都存着按下每个按钮的概率。
策略把「我处在什么情形?」变成「我该做什么?」——对每一种情形都如此。
一个常见的混淆:策略是「行动的规则」,而价值函数是「这条规则将赚到多少奖励」的估计。有些方法先学价值、再从中读出策略(Q学习);另一些则直接学策略(策略梯度)。别把两者混为一谈。
又称
另见