机器人学习

模仿学习

模仿学习,就是通过把正确的做法做给机器人看来教它,就像小孩学打蛋是看着父母做,而不是胡乱瞎试、直到把厨房弄得一团糟。你不让机器人为了追逐奖励而在无尽的试错中跌跌撞撞,而是给它一段专家把任务做得很好的记录——每一刻都配上专家当时选择的动作——机器人再训练自己的策略去复现这些选择。给它看足够多的好示例,它就学会像示范者那样行动。

最大的好处是,它绕开了基于奖励的学习中最难的两个环节:你不必手工拼凑一个棘手的奖励函数,机器人也不必摔上几千次才发现什么管用,因为专家早就知道了。它经典的软肋在于,一个纯粹的模仿者只认得别人给它看过的处境。一旦它飘到了专家从没去过的地方——一个略微古怪的角度、一个它从未真正到过的位置——它就没有示范可抄,于是小错误会像滚雪球一样越滚越大。现代方法会掺入一点纠正或额外练习来对抗这一点,但模仿学习的核心,仍是那个简单而强大的想法:照着例子学。

为了教机器人倒咖啡,人先扶着它的手臂顺顺当当地倒上几次;之后机器人便能自己模仿那个动作。

照着好例子学,而不是一路撞着去换取奖励。

行为克隆是模仿学习最简单的形式——在每个状态上直接照抄专家的动作。

又称
learning by imitation模仿式学习模仿式學習