智能体与前沿

世界模型(world model)

/ WURLD MOD-ul /

世界模型,是一幅关于「事情如何运作」的内在图景,它让一个系统能预测接下来会发生什么,从而在动手之前先想象一个动作的后果。你就有这么一幅:接住一个抛来的球,你已经不自觉地预测了它的弧线;你没去算物理,只是「知道」它会落在哪儿。对AI而言,拥有世界模型意味着它能在「脑中」跑一个小小的模拟——「我若这样做,那样的事就会随之而来」——而不是只对眼前之物盲目反应。

在AI里,这个想法有两种表现。有些系统被明确地配上了一个习得的世界模型:一个机器人或下棋的智能体,训练出一个组件去预测它所处环境的下一个状态,然后通过在那个模型里想象「推演」来规划,而不是每试一次都在真实世界里动作——在想象中失败,要便宜也安全得多。另一场更热的争论,则是:那些只被训练去预测文字的大语言模型,是否隐隐地建起了某种内在的世界模型——一种对事实、空间或因果的表征——还是说,它们「只是」把看似合理的词语缝在一起的高级模式匹配器。

这里的诚实尤其要紧,因为这是有争议的研究,而非定论。有耐人寻味的证据表明模型学到了结构化的内在表征(比如一个预测棋步的模型,似乎在追踪棋盘的局面);但也有同样清楚的证据表明它们缺乏可靠的世界模型:它们自相矛盾、在基本的物理或因果推理上失手、信心十足地说出不可能之事。稳妥的总结是:今天的模型,顶多拥有局部、斑驳、不可靠的世界模型——是有用的微光,而不是这个词容易让人误以为的那种稳健、连贯的理解。

一个带有习得世界模型的下棋智能体能「做梦」:它不必去玩成千上万局真实而缓慢的对局,而是训练一个预测器,去预测游戏对各步棋的反应,然后在那个想象出来的游戏里练习上百万次——又快,又没有真实世界的代价。问题在于:它的好坏全看它的模型;模型错的地方,建在其上的计划也跟着悄悄出错。

习得的世界模型让智能体在想象中排练——但它有多好,全看模型有多准。

「模型拥有一个世界模型」是一项主张,而非理所当然。某些结构化的内在表征确实存在,但它们既不完整也不可靠——模型可以追踪一盘棋,却照样断言你能同时身处两座城市。别把流畅的文字,当成底下藏着连贯理解的证据。

又称
internal world modelworld simulator世界模型内部世界模型