机器人学习

逆强化学习

逆强化学习是让机器人通过观察专家,去推断专家究竟想达成什么——是动作背后那个隐藏的目标,而不仅仅是动作本身。设想你在旁观一位老练的司机,却没人告诉你交通规则。你不会只是死记“到这儿左转、到那儿刹车”,而是慢慢推断出他似乎在意些什么——保持在车道内、与前车留出安全距离、平稳到达而不让车一顿一顿的。逆强化学习对机器人做的正是这件事:它从示范中重建出一个奖励函数,也就是那条评分规则,用来判断哪些结果是好的、哪些是坏的,并使这条规则最能解释专家为何会那样行事。

这把通常的套路彻底翻转了过来,名字也由此而来。在普通的强化学习里——这是机器人在人工智能那一面向强化学习这一领域借来的概念——你把一个奖励函数交给机器人,它再通过反复试错去摸索出一种好的行为。逆强化学习则把这个过程倒着跑:你把行为(专家的示范)交给它,它去反推出这套行为暗地里一直在优化的那个奖励函数。它的好处在于:奖励一旦被还原出来,抓住的就是意图,而不是表面的动作。一个领会了专家“为何在障碍物附近放慢”的机器人,能在示范从未涵盖的新情境里继续做出合理的选择,而不是一味重放旧动作。

难点在于:同样这几段示范,往往可以由许多不同的目标来解释——放慢车速可能意味着“省油”,也可能是“别颠坏货物”,或者“躲开一个坑”,而机器人未必分得清是哪一个。因此这类方法要靠一些额外的假设,比如在所有说得通的解释里偏好最简单的那个;而且通常要有相当数量干净的示范,推断出来的目标才靠得住。

一台仓库机器人观察工人们如何在场地里推车绕行,再借助逆强化学习,推断出一条没人说出口的奖励——避开人行通道——此后即便走在没有工人示范过的路线上,它也照样遵守这条规则。

机器人不是照搬路线,而是还原出那条塑造了路线的规则。

逆强化学习还原的是目标(奖励);而普通的强化学习——一种人工智能领域的方法——则从给定的奖励出发去学出行为。二者互为镜像。

又称
IRLinverse optimal control逆最优控制