視覺-語言-動作模型
視覺-語言-動作模型,常簡稱為 VLA,是一套龐大的、學習得來的系統:它接收機器人看到的畫面和別人用大白話給它的指令,然後直接輸出完成任務所需的動作。給它看一張雜亂桌面的攝影機圖像,再用日常語言告訴它把紅色馬克杯放進水槽,它就會生成一連串馬達指令,驅動機械臂過去——其間不需要為「認出杯子、規劃路徑、抓握」分別寫好的手工步驟。視覺、語言和動作被融進同一個模型,把「看到與聽到」徑直映射成「動起來」。
之所以把它們稱為機器人基礎模型,是因為它們和現代聊天機器人背後的大模型一樣:在海量而多樣的資料上訓練一次,然後被複用到許多任務上,而不是為每件雜活都從頭另造一個。一個 VLA 會吸收大量的圖像、文字和機器人示範,學到關於物體、詞語以及身體如何運動的廣泛常識。人們寄望於:這個共享的底子能讓一個模型驅動許多不同的機器人去做許多不同的活,甚至應對它從未被專門訓練過的指令——只因為它能像一個能幹的通才那樣理解語言。
它們最大的誘人之處在於通用:你不必再一項任務一項任務地給機器人編程,而是越來越多地可以用平常的話直接吩咐它,並借力於模型早已學到的一切。它們最大的難處在於:真實世界既不留情、又是物理的——聊天機器人讀錯一句話,頂多寫出一段笨拙的文字,可 VLA 看錯一個場景,卻可能把玻璃杯從檯面上碰下去。所以在能被信任、走出實驗室安全地行動之前,這些模型仍然需要仔細的測試、護欄,以及大量真實的、經過示範的機器人資料。
一台執行 VLA 的廚房機器人被給看了一眼檯面,只用一句口頭英語告訴它「給買回來的菜騰點地方」;僅憑這一張圖像和這一句話,它就自己琢磨出該把果盤挪到一邊、再把散放的盤子疊起來。
一個模型,把一眼所見和一句話變成整串動作。
VLA 是圖像理解類聊天機器人背後「視覺-語言模型」的會動作的表親:融合視覺與文字的思路相同,只是它最終輸出的是機器人的動作,而不是文字。