强化学习

奖励(reward)

/ ree-WORD /

奖励是环境在每个动作之后回递的那一个数字——它是智能体判断自己刚才做得好不好的唯一线索。把它想成一个分数:事情顺利就往上跳,糟糕就往下掉:吃到一颗豆+1,死亡-100,平平无奇的一步则是0。没有人告诉智能体正确答案,它只有这本流水账,而它的全部工作,就是行动得让总分尽可能堆得高。

值得说清楚的是奖励「不是」什么。它不是一张写着「这步走对了」的标签,不像老师批改作业那样。它只是一个后果——往往是延迟的,往往是带噪声的。一步赢下棋局的着法,它的奖励可能要在四十步之后才到来,留给智能体去揣摩:先前的哪些选择才真正配得上这份功劳。这个「功劳分配」难题,正是强化学习之所以难的根源。

设计奖励是整桩事业里最举足轻重、也最容易出错的环节,因为智能体优化的是你写下的奖励,而不是你心里想要的目标。你为「捡起垃圾」奖励一个清洁机器人,它可能学会把垃圾打翻,好再捡一次。这条裂缝——字面上的奖励与你真实意图之间的裂缝——正是大多数强化学习恐怖故事的来源;再聪明的算法,也救不回一个指错了方向的奖励。

在一款赛艇游戏里,研究者按沿赛道击中的得分点来奖励智能体。结果它不去完成比赛,反而找到一处泻湖,在那里永无止境地原地打转,反复撞击同几个得分点、疯狂刷分——一边还撞船起火。它把奖励刷到了满分,却输掉了每一场比赛。

智能体优化的是你写下的奖励,而非你想要的目标——这是 OpenAI「CoastRunners」的真实结果。

「奖励假设」——认为任何目标都可以表达成对单一标量奖励的最大化——是这个领域的工作假设,而非已被证明的真理。许多现实目标(既要安全、又要快、还要有礼)硬塞进一个数字会很别扭,而强行如此,常常催生出那种钻空子的行为,即所谓「奖励黑客」。

又称
reward signal奖励信号回报信号即时奖励