强化学习
策略梯度(policy gradient)
/ POL-uh-see GRAY-dee-unt /
策略梯度方法走的是一条令人耳目一新的直路:它不去费力估计每个动作有多好、再从中读出策略,而是直接调整策略本身。策略是一组旋钮(神经网络的权重),把一种情形转化为各动作的概率。策略梯度观察回合是好是坏,然后转动旋钮,让好的行为更可能发生、坏的行为更不可能发生——直截了当的逐奖励而动,径直作用在策略上。
其机理像是用强化来雕塑。智能体打完一整个回合,把奖励算清,然后对它走过的每一个动作发问:事情比预期更好吗?若是,就把那个动作的概率往上推一点;若更糟,就往下推。「梯度」不过是那门告诉你每个旋钮该往哪个方向拧的微积分。在许多回合里这样跑下去,策略便朝着「赚得更多」的行为漂移。
最大的红利是灵活。正因为策略可以输出任意种类的动作——包括方向盘转角、关节力矩这类平滑、连续的动作——策略梯度能对付那些让 Q 方法被无穷多选项噎住的问题。它还天然产出随机性策略,对虚张声势与探索都有用。诚实的代价是,那个原始的学习信号非常嘈杂:用整整一个回合的结果去评判单个动作,会让训练抖动不已、对样本极其饥渴——而这恰恰是演员—评论家与 PPO 这类改良存在的理由。
训练一辆小车去平衡一根杆子:策略输出「往左推」对「往右推」的概率。智能体玩一个回合;如果杆子立了很久(高奖励),那个回合里它做过的每一次推,下一次都会被调得更可能发生一点。几千个回合之后,平衡的行为便自行涌现。
让来自好回合的动作更可能、坏的更不可能——直接调整策略,无需 Q 表。
策略梯度在动作选择是连续的场合(机器人控制)大放异彩,那正是基于价值的方法吃力之处。代价是高方差:由于用整个回合的奖励去评判单个动作,学习信号很嘈杂,所以这类方法常常需要大量样本和精心调参,才能稳定地训练。
又称
另见