机器人学习
奖励塑形
奖励塑形,是一种沿途撒下一些小小的、有帮助的奖励的技巧,好让机器人不必在黑暗中乱抓乱碰就能学会一项难任务。光秃秃的奖励函数有个麻烦:对许多任务来说,机器人只有在最后才拿得到分——走通迷宫、把销钉插进孔里——在那之前一切都是零分。光靠盲目试错,它可能要摸索很久,才偶然撞上那唯一的回报。塑形则发出一些小提示——离出口更近一点就给点小奖励、把销钉对得更正一点也给——这样机器人就能得到“越来越接近”的反馈,一步步爬向目标,而不是盲目地乱逛。
微妙之处在于,加这些提示时不能偷偷改掉机器人最终该做的事。要是做得草率,这些“面包屑”可能会适得其反:只因机器人朝目标移动就奖励它,它可能学会在终点附近原地小跑,永远靠吃“接近奖励”过活,却始终不越过那条线。安全的做法叫“基于势能的塑形”,它只奖励状态之间真正的进展,从数学上保证最优行为分毫不变——机器人只是学得快得多。塑形改变的是学习的速度,而不是终点。
教机械臂叠积木时,你为“拿起一块积木”和“把它悬在塔上方”各加一点小奖励,于是它不再盲目失败,几小时就学会,而不是几周。
一路撒下的奖励“面包屑”引导学习,却不挪动终点线。
稀疏奖励(只在最后才给分)正是塑形通常要去医治的毛病。
又称
另见