机器人学习
世界模型
世界模型,是机器人学到的、关于自身环境如何运转的一份内部副本——一个它随身揣在脑子里的私人小模拟器。给定当前的情形和它正在考虑的某个动作,世界模型会预测接下来很可能发生什么:杯子会滑到哪里、门会怎样摆动、过一会儿摄像头又会看到什么。它带来的差别是:一台机器人究竟只能对眼前的东西作出反应,还是能在动手之前,悄悄地想象出每个选择可能带来的后果。
世界模型之所以强大,在于一旦学成,机器人就能在纯粹的想象中把它反复运行,比在现实中行动快得多、也便宜得多。它可以凭空设想出许多种可能的动作序列,在模型里看清哪些会带来好结果,然后才下决心采用那个最好的计划——这一切都无需碰一下真实的物体,也不用磨损一台真实的电机。这正是世界模型在机器人学习中如此被看重的原因:真实机器人的时间既慢、又贵、还有风险,而在一个好模型里想象出来的时间几乎是免费的。
麻烦在于,这个模型终究只是一种猜测,是由机器人经历过的体验拼凑而成的。在它见识丰富的地方,预测会很准;在它见得少的地方,它想象出的未来就会偏离现实,建立在这些摇摇晃晃的幻想之上的计划,可能以出人意料的方式失败。所以机器人必须不断收集新鲜的经验来修正自己的世界模型,而聪明的系统还会跟踪模型有多大把握——在它可靠的地方信任它,在它只是瞎猜的地方保持谨慎。
在去碰一摞积木之前,一台带有世界模型的机器人会先在脑中想象几种推法,预测哪一种会把塔推倒;然后它只执行模型认为安全的那一推。
先想象后果,再动手一次。
世界模型预测的是环境的“未来”;别把它和地图(描述东西在哪里)或策略(决定该做什么)混为一谈。
又称
另见