具身智能(embodied AI)
/ em-BOD-eed AY-EYE /
具身智能,是一种有身体、活在物理世界(或逼真模拟世界)里的智能——它通过传感器感知、通过马达行动,并从「挪动真实物体」的后果中学习。聊天机器人打交道的永远只是文字;一个具身智能体,却得对付重力、摩擦、一只比看上去更重的杯子,和一块滑溜溜的地板。它背后的想法是:真正的理解,也许需要这种「落地」——你是靠举起和摔落东西,才懂得「重」或「易碎」是什么意思,而不是靠读到它们。
它涵盖会行走、抓取、导航的机器人,也涵盖那些活在逼真模拟里、用来在碰真硬件之前廉价训练它们的智能体。近来的兴奋,来自试图把大AI模型那种宽广的知识赋予机器人——把模型对语言和图像的理解,接到一具能据此行动的身体上(「拿起那只红马克杯,放进水槽」)。那个梦想,是一个通用机器人,能像今天的聊天机器人处理开放式文字那样,处理开放式的物理任务。
但物理世界冷酷无情、不留情面,而这里的进展,远远落后于文字和图像上的进展——这就是诚实的标题。莫拉维克悖论一语中的:对人类轻而易举的事(叠衣服、跨过一地杂物、捏起一颗葡萄而不捏破),对机器却难如登天,而抽象推理相对反倒容易。错误无法用一句「哎呀」撤销——掉了的东西就掉了,用错了力就弄坏了东西。数据稀缺且采集缓慢(每一次试验都在实时发生),模拟与现实并不严丝合缝,硬件又昂贵又脆弱。具身智能在前进,但是审慎地、缓慢地前进,离我们在纯数字AI上看到的那种流畅,还差得很远。
你对一个家用机器人说「把桌子收拾干净」。它的语言模型听懂了请求,甚至知道酒杯易碎——可难的是物理那一关:精确判断杯子在哪儿、该用多大的握力(太小会滑、太大会碎),以及如何举起来又不撞翻盘子。如今「想」反倒是容易的那一头;仍然缺的,是那只小心翼翼的手。
莫拉维克悖论:听懂请求是容易的;那只小心翼翼的手才是难的。
数字AI与物理AI之间的鸿沟,是关键的洞见。一个模型能写出无懈可击的文章,却没法可靠地叠好一条毛巾,因为真实世界没有撤销键、几乎不给训练数据,还会即刻惩罚每一次失算。别想当然地以为,聊天机器人那个级别的流畅,很快就会迁移到身体上。