强化学习

演员—评论家(actor-critic)

/ AK-tur KRIT-ik /

演员—评论家是本领域两大主流家族的一桩巧妙联姻。演员是一个策略——它决定该做什么。评论家是一个价值函数——它评判当前情形有多好。它俩一同训练:演员行动,评论家评估,演员再借评论家的反馈来改进。这就像一位表演者配一名教练:教练不会表演,但它那犀利而即时的评判,能让表演者比单凭自我批评进步得快上许多。

这桩搭档的用意,是修补策略梯度最大的弱点。朴素的策略梯度用整整一个回合那充满噪声的最终结果去评判每个动作——反馈来得既晚又上蹿下跳。评论家则改为提供一个快速的、学来的估计,于是演员当场就能被告知「这一步在此处比预期更好」,无需苦等回合结束。这笔交易——接受评论家估计带来的一点偏差,换取噪声的大幅减少——通常会让学习平滑得多。

几乎每一个现代强化学习的主力,包括 PPO,骨子里都是演员—评论家。诚实的告诫是,你现在有两个学习者,必须步调一致地一起改进:若评论家的评判出错,它会把演员带偏;而无论哪一方跑得比另一方快,训练都可能摇晃乃至崩塌。两个相互作用的网络,本就比一个更难保持稳定——这是深度强化学习为何挑剔的一个反复出现的主题。

一只去够杯子的机械臂:演员决定每个关节如何运动;评论家估计「这个姿态离成功有多近?」若某个动作让评论家的估计跳升,演员当即就因此受到奖励——无需等到杯子被抓住,才学到那个动作有帮助。

演员决断,评论家评判。评论家那快速的反馈,驯服了策略梯度那嘈杂的、回合末才到的信号。

演员—评论家是用方差换偏差:评论家的估计比原始回合奖励平滑,却可能系统性地出错,而一个误导人的评论家会把演员引向错误的方向。让两个网络平衡地一同改进——谁也别抢跑——正是让它运转起来的实践技艺。

又称
actor criticA2CA3C演员评论家行动者—评论者