机器人学习

视觉-语言-动作模型

视觉-语言-动作模型,常简称为 VLA,是一套庞大的、学习得来的系统:它接收机器人看到的画面和别人用大白话给它的指令,然后直接输出完成任务所需的动作。给它看一张杂乱桌面的摄像头图像,再用日常语言告诉它把红色马克杯放进水槽,它就会生成一连串电机指令,驱动机械臂过去——其间不需要为“认出杯子、规划路径、抓握”分别写好的手工步骤。视觉、语言和动作被融进同一个模型,把“看到与听到”径直映射成“动起来”。

之所以把它们称为机器人基础模型,是因为它们和现代聊天机器人背后的大模型一样:在海量而多样的数据上训练一次,然后被复用到许多任务上,而不是为每件杂活都从头另造一个。一个 VLA 会吸收大量的图像、文字和机器人示范,学到关于物体、词语以及身体如何运动的广泛常识。人们寄望于:这个共享的底子能让一个模型驱动许多不同的机器人去做许多不同的活,甚至应对它从未被专门训练过的指令——只因为它能像一个能干的通才那样理解语言。

它们最大的诱人之处在于通用:你不必再一项任务一项任务地给机器人编程,而是越来越多地可以用平常的话直接吩咐它,并借力于模型早已学到的一切。它们最大的难处在于:真实世界既不留情、又是物理的——聊天机器人读错一句话,顶多写出一段笨拙的文字,可 VLA 看错一个场景,却可能把玻璃杯从台面上碰下去。所以在能被信任、走出实验室安全地行动之前,这些模型仍然需要仔细的测试、护栏,以及大量真实的、经过示范的机器人数据。

一台运行 VLA 的厨房机器人被给看了一眼台面,只用一句口头英语告诉它“给买回来的菜腾点地方”;仅凭这一张图像和这一句话,它就自己琢磨出该把果盘挪到一边、再把散放的盘子叠起来。

一个模型,把一眼所见和一句话变成整串动作。

VLA 是图像理解类聊天机器人背后“视觉-语言模型”的会动作的表亲:融合视觉与文字的思路相同,只是它最终输出的是机器人的动作,而不是文字。

又称
VLArobot foundation model机器人基础模型機器人基礎模型